無料で始める

人工知能はゲーム開発を急速に変化させており、大規模にコンテンツを生成、検証、提供する新しい方法を可能にしています。AIは手続き的なレベル生成、適応的な難易度、NPCの行動に広く使用されてきましたが、今ではそれをより動的なもの—自動化されたストーリーテリングとゲーム駆動のナラティブ体験に適用しています。

Gig Game Corpでは、リアルタイムで動的で声優付きのゲームコンテンツを生成するAI駆動のシステムを開発しています。このための主要なテストケースの1つが、AIを使用してトリビアの質問を生成し、その正確性を検証し、環境音効果とオーディオ後処理を備えたリアルなボイスオーバーを合成するゲーム**「Would I Lie??」です。このアプローチにより、質問の手動スクリプト化、キャラクターダイアログの作成、ボイスオーバーの録音の必要性を排除しながら、一貫して高品質なプレイヤー体験を保証する自動化されたコンテンツパイプライン**を作成できます。

この記事では、このシステムを構築する際の技術的アプローチ、AI生成コンテンツの検証方法、そしてより没入感のあるゲーム体験を作成するためのサウンドエンジニアリングへのAIの適用方法を概説します。

ステップ1: AI生成の質問とナラティブの作成

パイプラインの最初のステップはコンテンツ生成です。「Would I Lie??」の場合、これはトリビアの質問、可能な回答、ゲーム内ホストのダイアログを動的に作成することを意味します。数千の質問を手動でキュレーションする代わりに、GPT-4を使用してJSON形式で構造化されたコンテンツを生成し、それを追加のAIモデルで処理およびフィルタリングします。

これを分解すると、次のステップに従います:

  1. トピック生成 – AIは事前定義された難易度レベルとカテゴリに基づいてトピックを選択し、実際のトリビアの主題と偽のトリビアの主題の両方を生成します。
  2. 質問と回答の生成 – AIは与えられたトピックに基づいて多肢選択式の質問を作成し、1つの正しい回答といくつかのもっともらしい誤った回答を含むようにします。
  3. 構造化出力フォーマット – AIは生成された質問をゲームエンジンにシームレスに統合できるJSONスキーマに構造化します。

トリビア質問のAI生成JSON出力例

{
  "question": "世界初の『外交的いたずら戦争』を引き起こした歴史的出来事は何ですか?",
  "answers": [
    { "text": "フレンチ・インディアン戦争", "isCorrect": false },
    { "text": "1835年のトレド戦争", "isCorrect": true },
    { "text": "1978年のアイスランドタラ戦争", "isCorrect": false },
    { "text": "1962年のペンギン条約", "isCorrect": false }
  ],
  "difficulty": "medium",
  "category": "history"
}

JSONで出力を構造化することで、質問をリアルタイムで効率的に保存、検証、取得でき、大規模で動的に生成された質問プールを可能にし、多様性と再プレイ性を保証します。

ステップ2: AI駆動の検証とフィルタリング

AI生成コンテンツにおける最も重要な課題の1つは品質管理です。言語モデルは魅力的な質問を生成する能力が高いですが、必ずしも事実の正確性、バランス、適切な表現を保証するわけではありません。これに対処するために、多段階の検証プロセスを適用します:

  1. 実際の質問の事実確認 – AI生成の実際のトリビア質問は、事実の正確性を検証するために訓練された二次AIモデルに対して検証されます。質問が信頼性のしきい値を超えない場合、それはレビューのためにフラグが立てられるか、破棄されます。
  2. 重複検出ジャカード類似度とレーベンシュタイン距離アルゴリズムを使用して、以前に生成された質問とあまりにも類似している質問を検出し、フィルタリングします。これにより冗長性が防止され、多様な質問セットが保証されます。
  3. 難易度調整 – AIは質問が意図された難易度レベルに一致しているかどうかを評価します。たとえば、「難しい」質問は、歴史的なプレイヤーデータに基づいて正解される確率が低いはずです。

これらの安全策を実施することで、検証済みの高品質な質問のみが最終ゲームに入ることを保証します。

ステップ3: AI合成の声優とダイアログ生成

質問が生成され、検証された後、次のステップはAI生成のボイスオーバーを通じてプレイヤーに届けることです。事前録音された音声を使用する代わりに、テキスト読み上げ(TTS)技術、特にElevenLabsのAI駆動の音声合成を使用して、ゲーム内ホストを生き生きとさせます。

ElevenLabsを呼び出して実際の音声を生成する前に、まずOpenAIを使用して別のAIパスを実行し質問の紹介回答の公開のための構造化されたダイアログを作成します。このアプローチにより、各コンポーネントが慎重に制御され、意図しない逸脱、不必要な詳細、または正解の早期開示を避けることができます。

オーバーランと幻覚を防ぐための制御されたAIプロンプト

正確性と構造を維持するために、各AIプロンプトに具体的な指示を提供し、明確に定義します:

  • AIがどのように開始するべきか – 応答がゲームのトーンとスタイルに一致する事前定義された紹介で明確で構造化された形式で始まることを保証します。
  • AIがどのように終了するべきか – AIにどこで停止するかを明示的に指示し、モデルが追加情報を発明したり、プレイヤーの応答を予測しようとしたりする「オーバーラン」を防ぎます。
  • 含めるべきでないもの – 早期の回答ヒント、無関係なコメント、推測的なダイアログなどの不必要な詳細を制限します。

たとえば、質問のナレーションを生成する際、AIプロンプトを次のように構造化します:

  • トリビアの質問のトーンを設定する魅力的な紹介で開始します。
  • 選択肢を明確に提示し、中立を保つようにします。
  • **「どう思いますか?」**のような事前定義されたフレーズで終了し、AIが正解を推測するのを防ぎます。

同様に、回答の公開ナレーションを生成する際には:

  • プレイヤーの選択を再確認し、質問を再述することから開始し、連続性を維持します。
  • 正解を明確に発表し、事実として届けます。
  • **「正解しましたか?」**のような短い事前定義された応答で終了し、追加の不要なAI生成コメントを防ぎます。

AI幻覚リスクの最小化

質問と回答の生成を別々のAIパスに分割し開始点と停止点を厳密に定義することで、回答を誤って公開したり、無関係な情報を導入したりする可能性のあるAI幻覚を排除します。AIに1つのリクエストで完全なダイアログを生成させると、結果を「予測」しようとし、望ましくないバイアス、不整合、または不必要なフィラーコンテンツを引き起こす可能性があります。

各トリビアの質問は、異なる声のスタイルと個性を持つ2人のAI生成ホストキャラクターによってナレーションされます。彼らのダイアログは動的に生成され、構造化された形式に従います。

AI生成ダイアログの例

{
  "Conversation": [
    { "VoiceId": "2", "Dialog": "さて、皆さん!次の質問です... 世界初の『外交的いたずら戦争』を引き起こした歴史的出来事は何ですか?" },
    { "VoiceId": "3", "Dialog": "おお、私は良いいたずら戦争が大好きです!これにはゴム製の鶏と偽の条約が含まれているべきです。" },
    { "VoiceId": "2", "Dialog": "選択肢は... A) フレンチ・インディアン戦争、B) 1835年のトレド戦争、C) 1978年のアイスランドタラ戦争、またはD) 1962年のペンギン条約です。" },
    { "VoiceId": "3", "Dialog": "正直に言うと、ペンギンであってほしいです。あの小さな奴らは無慈悲です。" }
  ]
}

構造化されたダイアログが完成したら、それをElevenLabsに送信して高品質の音声合成を行い、ゲームのAI生成ホストを生き生きとさせ、厳密なコンテンツの正確性を維持しながら、明確で魅力的でエラーのないナレーションを保証します。AI生成ダイアログをこの形式で構造化することで、手動スクリプト化の必要性を排除し、自然で動的な会話の流れを維持します。

ステップ4: AI駆動のサウンドエンジニアリングと後処理

没入型ストーリーテリング体験を作成する主要な要素はサウンドデザインです。AI生成のボイスオーバーをより本物に感じさせるために、NAudioを使用してオーディオ処理技術を適用します。これには以下が含まれます:

  • 背景の群衆ノイズのオーバーレイ – 拍手、笑い声、緊張感のあるざわめきなどの観客の反応を追加します。
  • 動的な音声効果 – ゲーム内の異なる環境に合わせてリバーブ、エコー、歪みを適用します。
  • ラジオスタイルのフィルタリング – ビンテージ放送をシミュレートするために周波数範囲を変更します。
  • オーディオミキシングの自動化 – 複数のボイスオーバーと音響効果をリアルタイムで組み合わせます。

特別な状況: シーンの遷移と質問以外のダイアログの処理

トリビアの質問と回答の公開を生成するだけでなく、AIを使用してゲームの紹介、スコア更新、ラウンドの遷移、最終まとめなどの重要なゲームの瞬間のためのシーンの遷移と質問以外のダイアログを作成します。これらのセグメントは、質問と回答の形式に基づいて構造化されていないため、舞台を設定し、プレイヤーを引き込み、ゲームプレイ要素間のシームレスな流れを提供するために異なるアプローチが必要です。

多様性と再プレイ性を確保するために、OpenAIを使用して各シーンの複数のバージョンを生成し、ゲームがプレイされるたびに異なるインタラクションとトーンの変化を可能にします。さらに、各シーンごとにキャラクターをランダムにプログラム的に切り替え、インタラクションが新鮮で動的に感じられるようにします。たとえば、あるプレイスルーでは、スコア更新がメインホストと共同ホストによって提供されるかもしれませんが、別のプレイスルーでは、風変わりなアナウンサー、熱心なプロデューサー、またはインターンなどの二次キャラクターが引き継ぎ、ユーモアと予測不可能性を追加します。キャラクターの割り当てをランダム化することで、多様なインタラクションの範囲を作成し、ダイアログが繰り返しになるのを防ぎ、各ゲームセッションをユニークにします。

構造を維持し、ダイアログの不整合を防ぐために、各シーンの開始と終了を明確に定義し、異なるセグメント間の遷移がシームレスであることを保証します。各AI生成スクリプトは、前後のダイアログシーンとスムーズに接続するように設計されており、会話の不自然なシフトを防ぎます。事前定義されたイントロ/アウトロマーカーシーン固有の制約を組み合わせて使用し、AI生成コンテンツが意図されたナラティブフローの範囲内に留まるようにします。

スクリプトが完成したら、質問生成プロセスと同様に、ElevenLabsの音声技術を使用して合成され、環境音効果とオーディオ遷移と混合され、没入感を高め、シーン間の違いを際立たせます。たとえば、エンディングシーケンスには、ゲームの結論を強化するためにライブ観客のエネルギーをシミュレートする群衆の歓声オーバーレイが含まれます。一方、プレショーバックステージシーンには、メインのゲームショー自体と事前紹介のダイアログを聴覚的に区別するために電話フィルターパスが適用されます。これらの音響効果と処理技術は、より魅力的で映画的な体験を作成し、各シーンを独特に感じさせ、全体の制作品質を強化します。

将来のAIサウンドデザイン能力の拡張計画

今後、AI駆動のサウンドデザインツールを拡張し、AIがリアルタイムで動的に適用できるより大きな音響効果ライブラリと追加のオーディオフィルターを開発する予定です。これにより、シーンに基づいてオーディオ効果を調整できるようになり、空の部屋でのエコーの追加や劇的な効果のための嵐の音のオーバーレイなどが可能になります。

また、これらのツールを使用して自動化されたホラーとSFのオーディオドラマを作成するAI生成の古いスタイルのラジオストーリーテリングチャンネルを立ち上げる予定です。これらは、AIストーリーテリング能力の技術的デモンストレーションとして、また新しいエンターテイメントの形として機能し、AIが物語、ダイアログ、完全にミックスされたサウンドスケープを人間の介入なしに動的に生成できることを示します。

最後の考慮事項: AIの使用とコスト効率

AIは動的なストーリーテリングとコンテンツ生成のための強力なツールですが、それには実際のコストが伴います—計算資源と財務的なオーバーヘッドの両方です。各AI生成の音声行、リアルタイムのインタラクション、または動的に構築されたシーンは、処理能力とAPIコールを必要とし、使用量に応じてスケールします。ゲームにおけるAIの採用が進むにつれて、これらのコストを理解し管理することが開発の重要な部分になります。

AI駆動の没入感とコスト効率のバランスを取るために、このゲームの2つのバージョンを設計しています。それぞれが異なるユースケースに最適化されています。

最初のバージョンは、AIがプレイヤーやチームと名前で直接対話できるように、リアルタイムで遷移シーンのダイアログを動的に生成します。このバージョンは、YouTubeやTwitchのようなプラットフォームでのライブ放送を目的としており、ゲームセッションを単一の孤立した体験として制御します。セッションごとに1回しか実行されないため、AI処理のコストは管理可能なままです。このバージョンは、AI生成のホストがリアルタイムで観客と対話できるようにすることで、コストを正当化する完全に動的な体験を提供し、エンゲージメントを強化します。

しかし、AI駆動のダイアログを生成するのは瞬時ではありません。平均して、ダイアログの行を生成して音声に変換するのに4〜7秒かかり、1回のコールあたり**$0.16〜$0.20のコストがかかります。これにより、プレイヤー体験を妨げないように、AI生成コンテンツがいつどのように作成されるかを慎重に計画する必要がありました。目立つ遅延を最小限に抑えるために、必要になる前にコンテンツを事前にロードするか、プレイヤーが質問に答える時間が与えられる自然なポーズ中に生成**するようにシステムを設計しました。これにより、シームレスな体験が保証され、プレイヤーがゲームから離れる可能性のある中断を防ぎます。

コストの懸念に対処するために、Gig.Game内で紹介される2番目のバージョンは、プライベートゲームプレイを目的としており、過剰なコストなしに大量のセッションをサポートする必要があります。すべてのセッションでリアルタイムのAIダイアログを生成する代わりに、AIが作成した遷移とダイアログセグメントのセットを事前に生成し、高品質で一貫した体験を保証しながら、オンザフライのAI処理を最小限に抑えます。これにより、没入感を犠牲にすることなく、スケーラブルでコスト効率の高いゲームプレイを提供できます。

ここでの重要なポイントは、AIの使用は戦略的に計画されなければならないということです。リアルタイムのAI駆動体験は比類のないエンゲージメントを提供しますが、ライブ放送のような制御された単一インスタンス環境に最適です。対照的に、事前生成されたAIコンテンツは、継続的なAI処理コストを発生させることなく、スケーラブルで再現可能なゲームプレイを可能にします。両方のアプローチを活用することで、AIがコストのボトルネックではなく、革新の推進力であり続けることを保証し、没入感のあるプレイヤー体験に必要な流動性とエンゲージメントを維持します。

AI4 2025: AIストーリーテリングの実践を紹介

AI駆動のストーリーテリングエンジンをさらに洗練させる中で、トリビアゲームを超えたAI生成のナラティブ体験の新しいアプリケーションを探求しています。これには以下が含まれます:

  • 自動化されたインタラクティブフィクション – プレイヤーの選択に基づいて変化するAI生成の分岐ナラティブ。
  • AI指導のゲームボイスオーバー – プレイヤーの行動にリアルタイムで反応する動的なNPC。
  • AI駆動のライブゲームイベント – AI生成のダイアログとオーディオで自動的に進化するゲーム内ストーリー。

私はラスベガスで開催されるAI4 2025に参加し、AI駆動のゲーム開発で他の人々がどのように革新しているかを見るのを楽しみにしています。また、AIがナラティブ生成、声優、サウンドエンジニアリングを自動化する方法を紹介するAIストーリーテリング技術のスイートデモを行います。

ゲームにおけるAIの未来に興味があるなら、つながりましょう。AIがストーリーテリングに最大の影響を与えるのはどこだと思いますか?話し合いましょう。

前の記事

ゲームショーの未来がここに – あなたも招待されています!