
人工知能はゲーム開発を急速に変化させており、大規模にコンテンツを生成、検証、提供する新しい方法を可能にしています。AIは手続き的なレベル生成、適応的な難易度、NPCの行動に広く使用されてきましたが、今ではそれをより動的なもの—自動化されたストーリーテリングとゲーム駆動のナラティブ体験に適用しています。
Gig Game Corpでは、リアルタイムで動的で声優付きのゲームコンテンツを生成するAI駆動のシステムを開発しています。このための主要なテストケースの1つが、AIを使用してトリビアの質問を生成し、その正確性を検証し、環境音効果とオーディオ後処理を備えたリアルなボイスオーバーを合成するゲーム**「Would I Lie??」です。このアプローチにより、質問の手動スクリプト化、キャラクターダイアログの作成、ボイスオーバーの録音の必要性を排除しながら、一貫して高品質なプレイヤー体験を保証する自動化されたコンテンツパイプライン**を作成できます。
この記事では、このシステムを構築する際の技術的アプローチ、AI生成コンテンツの検証方法、そしてより没入感のあるゲーム体験を作成するためのサウンドエンジニアリングへのAIの適用方法を概説します。
パイプラインの最初のステップはコンテンツ生成です。「Would I Lie??」の場合、これはトリビアの質問、可能な回答、ゲーム内ホストのダイアログを動的に作成することを意味します。数千の質問を手動でキュレーションする代わりに、GPT-4を使用してJSON形式で構造化されたコンテンツを生成し、それを追加のAIモデルで処理およびフィルタリングします。
これを分解すると、次のステップに従います:
{
"question": "世界初の『外交的いたずら戦争』を引き起こした歴史的出来事は何ですか?",
"answers": [
{ "text": "フレンチ・インディアン戦争", "isCorrect": false },
{ "text": "1835年のトレド戦争", "isCorrect": true },
{ "text": "1978年のアイスランドタラ戦争", "isCorrect": false },
{ "text": "1962年のペンギン条約", "isCorrect": false }
],
"difficulty": "medium",
"category": "history"
}
JSONで出力を構造化することで、質問をリアルタイムで効率的に保存、検証、取得でき、大規模で動的に生成された質問プールを可能にし、多様性と再プレイ性を保証します。
AI生成コンテンツにおける最も重要な課題の1つは品質管理です。言語モデルは魅力的な質問を生成する能力が高いですが、必ずしも事実の正確性、バランス、適切な表現を保証するわけではありません。これに対処するために、多段階の検証プロセスを適用します:
これらの安全策を実施することで、検証済みの高品質な質問のみが最終ゲームに入ることを保証します。
質問が生成され、検証された後、次のステップはAI生成のボイスオーバーを通じてプレイヤーに届けることです。事前録音された音声を使用する代わりに、テキスト読み上げ(TTS)技術、特にElevenLabsのAI駆動の音声合成を使用して、ゲーム内ホストを生き生きとさせます。
ElevenLabsを呼び出して実際の音声を生成する前に、まずOpenAIを使用して別のAIパスを実行し、質問の紹介と回答の公開のための構造化されたダイアログを作成します。このアプローチにより、各コンポーネントが慎重に制御され、意図しない逸脱、不必要な詳細、または正解の早期開示を避けることができます。
正確性と構造を維持するために、各AIプロンプトに具体的な指示を提供し、明確に定義します:
たとえば、質問のナレーションを生成する際、AIプロンプトを次のように構造化します:
同様に、回答の公開ナレーションを生成する際には:
質問と回答の生成を別々のAIパスに分割し、開始点と停止点を厳密に定義することで、回答を誤って公開したり、無関係な情報を導入したりする可能性のあるAI幻覚を排除します。AIに1つのリクエストで完全なダイアログを生成させると、結果を「予測」しようとし、望ましくないバイアス、不整合、または不必要なフィラーコンテンツを引き起こす可能性があります。
各トリビアの質問は、異なる声のスタイルと個性を持つ2人のAI生成ホストキャラクターによってナレーションされます。彼らのダイアログは動的に生成され、構造化された形式に従います。
{
"Conversation": [
{ "VoiceId": "2", "Dialog": "さて、皆さん!次の質問です... 世界初の『外交的いたずら戦争』を引き起こした歴史的出来事は何ですか?" },
{ "VoiceId": "3", "Dialog": "おお、私は良いいたずら戦争が大好きです!これにはゴム製の鶏と偽の条約が含まれているべきです。" },
{ "VoiceId": "2", "Dialog": "選択肢は... A) フレンチ・インディアン戦争、B) 1835年のトレド戦争、C) 1978年のアイスランドタラ戦争、またはD) 1962年のペンギン条約です。" },
{ "VoiceId": "3", "Dialog": "正直に言うと、ペンギンであってほしいです。あの小さな奴らは無慈悲です。" }
]
}
構造化されたダイアログが完成したら、それをElevenLabsに送信して高品質の音声合成を行い、ゲームのAI生成ホストを生き生きとさせ、厳密なコンテンツの正確性を維持しながら、明確で魅力的でエラーのないナレーションを保証します。AI生成ダイアログをこの形式で構造化することで、手動スクリプト化の必要性を排除し、自然で動的な会話の流れを維持します。
没入型ストーリーテリング体験を作成する主要な要素はサウンドデザインです。AI生成のボイスオーバーをより本物に感じさせるために、NAudioを使用してオーディオ処理技術を適用します。これには以下が含まれます:
トリビアの質問と回答の公開を生成するだけでなく、AIを使用してゲームの紹介、スコア更新、ラウンドの遷移、最終まとめなどの重要なゲームの瞬間のためのシーンの遷移と質問以外のダイアログを作成します。これらのセグメントは、質問と回答の形式に基づいて構造化されていないため、舞台を設定し、プレイヤーを引き込み、ゲームプレイ要素間のシームレスな流れを提供するために異なるアプローチが必要です。
多様性と再プレイ性を確保するために、OpenAIを使用して各シーンの複数のバージョンを生成し、ゲームがプレイされるたびに異なるインタラクションとトーンの変化を可能にします。さらに、各シーンごとにキャラクターをランダムにプログラム的に切り替え、インタラクションが新鮮で動的に感じられるようにします。たとえば、あるプレイスルーでは、スコア更新がメインホストと共同ホストによって提供されるかもしれませんが、別のプレイスルーでは、風変わりなアナウンサー、熱心なプロデューサー、またはインターンなどの二次キャラクターが引き継ぎ、ユーモアと予測不可能性を追加します。キャラクターの割り当てをランダム化することで、多様なインタラクションの範囲を作成し、ダイアログが繰り返しになるのを防ぎ、各ゲームセッションをユニークにします。
構造を維持し、ダイアログの不整合を防ぐために、各シーンの開始と終了を明確に定義し、異なるセグメント間の遷移がシームレスであることを保証します。各AI生成スクリプトは、前後のダイアログシーンとスムーズに接続するように設計されており、会話の不自然なシフトを防ぎます。事前定義されたイントロ/アウトロマーカーとシーン固有の制約を組み合わせて使用し、AI生成コンテンツが意図されたナラティブフローの範囲内に留まるようにします。
スクリプトが完成したら、質問生成プロセスと同様に、ElevenLabsの音声技術を使用して合成され、環境音効果とオーディオ遷移と混合され、没入感を高め、シーン間の違いを際立たせます。たとえば、エンディングシーケンスには、ゲームの結論を強化するためにライブ観客のエネルギーをシミュレートする群衆の歓声オーバーレイが含まれます。一方、プレショーバックステージシーンには、メインのゲームショー自体と事前紹介のダイアログを聴覚的に区別するために電話フィルターパスが適用されます。これらの音響効果と処理技術は、より魅力的で映画的な体験を作成し、各シーンを独特に感じさせ、全体の制作品質を強化します。
今後、AI駆動のサウンドデザインツールを拡張し、AIがリアルタイムで動的に適用できるより大きな音響効果ライブラリと追加のオーディオフィルターを開発する予定です。これにより、シーンに基づいてオーディオ効果を調整できるようになり、空の部屋でのエコーの追加や劇的な効果のための嵐の音のオーバーレイなどが可能になります。
また、これらのツールを使用して自動化されたホラーとSFのオーディオドラマを作成するAI生成の古いスタイルのラジオストーリーテリングチャンネルを立ち上げる予定です。これらは、AIストーリーテリング能力の技術的デモンストレーションとして、また新しいエンターテイメントの形として機能し、AIが物語、ダイアログ、完全にミックスされたサウンドスケープを人間の介入なしに動的に生成できることを示します。
AIは動的なストーリーテリングとコンテンツ生成のための強力なツールですが、それには実際のコストが伴います—計算資源と財務的なオーバーヘッドの両方です。各AI生成の音声行、リアルタイムのインタラクション、または動的に構築されたシーンは、処理能力とAPIコールを必要とし、使用量に応じてスケールします。ゲームにおけるAIの採用が進むにつれて、これらのコストを理解し管理することが開発の重要な部分になります。
AI駆動の没入感とコスト効率のバランスを取るために、このゲームの2つのバージョンを設計しています。それぞれが異なるユースケースに最適化されています。
最初のバージョンは、AIがプレイヤーやチームと名前で直接対話できるように、リアルタイムで遷移シーンのダイアログを動的に生成します。このバージョンは、YouTubeやTwitchのようなプラットフォームでのライブ放送を目的としており、ゲームセッションを単一の孤立した体験として制御します。セッションごとに1回しか実行されないため、AI処理のコストは管理可能なままです。このバージョンは、AI生成のホストがリアルタイムで観客と対話できるようにすることで、コストを正当化する完全に動的な体験を提供し、エンゲージメントを強化します。
しかし、AI駆動のダイアログを生成するのは瞬時ではありません。平均して、ダイアログの行を生成して音声に変換するのに4〜7秒かかり、1回のコールあたり**$0.16〜$0.20のコストがかかります。これにより、プレイヤー体験を妨げないように、AI生成コンテンツがいつどのように作成されるかを慎重に計画する必要がありました。目立つ遅延を最小限に抑えるために、必要になる前にコンテンツを事前にロードするか、プレイヤーが質問に答える時間が与えられる自然なポーズ中に生成**するようにシステムを設計しました。これにより、シームレスな体験が保証され、プレイヤーがゲームから離れる可能性のある中断を防ぎます。
コストの懸念に対処するために、Gig.Game内で紹介される2番目のバージョンは、プライベートゲームプレイを目的としており、過剰なコストなしに大量のセッションをサポートする必要があります。すべてのセッションでリアルタイムのAIダイアログを生成する代わりに、AIが作成した遷移とダイアログセグメントのセットを事前に生成し、高品質で一貫した体験を保証しながら、オンザフライのAI処理を最小限に抑えます。これにより、没入感を犠牲にすることなく、スケーラブルでコスト効率の高いゲームプレイを提供できます。
ここでの重要なポイントは、AIの使用は戦略的に計画されなければならないということです。リアルタイムのAI駆動体験は比類のないエンゲージメントを提供しますが、ライブ放送のような制御された単一インスタンス環境に最適です。対照的に、事前生成されたAIコンテンツは、継続的なAI処理コストを発生させることなく、スケーラブルで再現可能なゲームプレイを可能にします。両方のアプローチを活用することで、AIがコストのボトルネックではなく、革新の推進力であり続けることを保証し、没入感のあるプレイヤー体験に必要な流動性とエンゲージメントを維持します。
AI駆動のストーリーテリングエンジンをさらに洗練させる中で、トリビアゲームを超えたAI生成のナラティブ体験の新しいアプリケーションを探求しています。これには以下が含まれます:
私はラスベガスで開催されるAI4 2025に参加し、AI駆動のゲーム開発で他の人々がどのように革新しているかを見るのを楽しみにしています。また、AIがナラティブ生成、声優、サウンドエンジニアリングを自動化する方法を紹介するAIストーリーテリング技術のスイートデモを行います。
ゲームにおけるAIの未来に興味があるなら、つながりましょう。AIがストーリーテリングに最大の影響を与えるのはどこだと思いますか?話し合いましょう。