
人工智能正在迅速改变游戏开发,能够以规模化的方式生成、验证和交付内容。虽然AI已经广泛用于程序化关卡生成、自适应难度和NPC行为,但我们现在将其应用于更具动态性的领域——自动化叙事和游戏驱动的叙事体验。
在Gig Game Corp,我们正在开发AI驱动的系统,实时生成动态的、配音的游戏内容。我们的主要测试案例之一是**“Would I Lie??”,这是一款使用AI生成琐事问题、验证其准确性,并合成逼真配音的游戏,配有环境音效和音频后期处理。这种方法使我们能够创建一个自动化内容管道**,无需手动编写问题脚本、撰写角色对话和录制配音,同时确保玩家体验的一致高质量。
本文概述了我们在构建该系统时采用的技术方法,如何验证AI生成的内容,以及如何将AI应用于声音工程以创造更具沉浸感的游戏体验。
管道的第一步是内容生成。对于“Would I Lie??”,这意味着动态创建琐事问题、可能的答案和游戏内主持人对话。我们使用GPT-4生成JSON格式的结构化内容,而不是手动策划数千个问题,然后由其他AI模型进行处理和过滤。
具体步骤如下:
{
"question": "是什么历史事件导致了世界上第一次‘外交恶作剧战争’?",
"answers": [
{ "text": "法印战争", "isCorrect": false },
{ "text": "1835年的托莱多战争", "isCorrect": true },
{ "text": "1978年的冰岛鳕鱼战争", "isCorrect": false },
{ "text": "1962年的企鹅条约", "isCorrect": false }
],
"difficulty": "medium",
"category": "history"
}
通过以JSON格式结构化输出,我们可以高效地存储、验证和检索问题,实时生成一个庞大的、动态的问题库,确保多样性和可重玩性。
AI生成内容的一个最关键挑战是质量控制。虽然语言模型非常擅长生成引人入胜的问题,但它们并不总能保证事实准确性、平衡性或适当的措辞。为了解决这个问题,我们应用了一个多步骤验证过程:
通过实施这些保障措施,我们确保只有经过验证的高质量问题进入最终游戏。
一旦问题生成并验证,下一步是通过AI生成的配音将其传递给玩家。我们使用文本到语音(TTS)技术,特别是ElevenLabs的AI驱动语音合成技术,而不是使用预录音频,使游戏内主持人栩栩如生。
在调用ElevenLabs生成实际语音之前,我们首先使用OpenAI进行单独的AI处理,为问题介绍和答案揭示创建结构化对话。这种方法确保每个组件都得到精心控制,避免意外偏离、不必要的详细说明或过早披露正确答案。
为了保持准确性和结构性,我们在每个AI提示中提供具体指示,明确定义:
例如,在生成问题叙述时,我们将AI提示结构化如下:
同样,在生成答案揭示叙述时,我们:
通过将问题和答案生成分为单独的AI处理并严格定义开始和停止点,我们消除了AI幻觉,这可能会无意中揭示答案或引入不相关的信息。如果我们允许AI在一次请求中生成完整对话,它可能会试图“预测”结果,导致不必要的偏见、不一致或不必要的填充内容。
每个琐事问题由两个AI生成的主持人角色叙述,每个角色具有独特的声音风格和个性。他们的对话是动态生成的,并遵循结构化格式。
{
"Conversation": [
{ "VoiceId": "2", "Dialog": "好了,大家!这是你的下一个问题……是什么历史事件导致了世界上第一次‘外交恶作剧战争’?" },
{ "VoiceId": "3", "Dialog": "哦,我喜欢一个好的恶作剧战争!这最好涉及橡皮鸡和假条约。" },
{ "VoiceId": "2", "Dialog": "你的选项是……A) 法印战争,B) 1835年的托莱多战争,C) 1978年的冰岛鳕鱼战争,或D) 1962年的企鹅条约。" },
{ "VoiceId": "3", "Dialog": "老实说,我希望是企鹅。那些小家伙是无情的。" }
]
}
一旦结构化对话完成,我们将其发送到ElevenLabs进行高质量语音合成,确保清晰、引人入胜且无错误的叙述,使游戏的AI生成主持人栩栩如生,同时保持严格的内容准确性。通过以这种格式结构化AI生成的对话,我们消除了手动编写脚本的需要,同时保持自然和动态的对话流。
创造沉浸式叙事体验的一个主要因素是声音设计。为了使AI生成的配音更具真实性,我们使用NAudio应用音频处理技术,包括:
除了生成琐事问题和答案揭示,我们还使用AI为关键游戏时刻创建场景转换和非问题对话,如游戏介绍、得分更新、回合转换和最终总结。这些片段需要不同的方法,因为它们不是围绕问答格式结构化的,而是用于设定舞台、吸引玩家并在游戏元素之间提供无缝流动。
为了确保多样性和可重玩性,我们使用OpenAI生成每个场景的多个版本,允许每次游戏时不同的互动和语调变化。此外,我们以编程方式随机切换角色,确保互动感觉新鲜和动态。例如,在一次游戏中,得分更新可能由主要主持人和联合主持人传达,而在另一次游戏中,次要角色——如古怪的播音员、过于热情的制片人,甚至是实习生——可能接管,增加幽默和不可预测性。通过随机分配角色,我们创造了多样化的互动,防止对话变得重复,使每个游戏会话独特。
为了保持结构并防止对话不一致,我们清晰定义每个场景的开始和结束,确保不同片段之间的过渡是无缝的。每个AI生成的脚本旨在与前后对话场景平滑连接,防止对话中出现突兀或不自然的转换。我们使用预定义的介绍/结尾标记和场景特定的约束的组合,以确保AI生成的内容保持在预期叙事流的范围内。
一旦脚本完成,就像问题生成过程一样,它们也使用ElevenLabs语音技术进行合成,并与环境音效和音频过渡混合,以增强沉浸感并区分场景。例如,结束序列将有一个人群欢呼叠加,以模拟现场观众的能量,强化游戏的结尾。同时,预演后台场景将对音频应用电话过滤器处理,在听觉上将预介绍对话与主要游戏节目本身区分开来。这些音效和处理技术有助于创造更具吸引力和电影感的体验,使每个场景感觉独特,并强化整体制作质量。
展望未来,我们计划通过开发更大的音效库和额外的音频过滤器,使AI能够在实时动态应用音频效果,来扩展我们的AI驱动声音设计工具。这将使系统能够根据场景调整音频效果,无论是为戏剧效果添加空房间中的回声还是叠加风暴声。
我们还计划推出一个AI生成的老式广播叙事频道,将使用这些工具创建自动化的恐怖和科幻音频剧。这些将作为我们AI叙事能力的技术演示和一种新形式的娱乐,展示AI如何动态生成故事、对话和完全混合的音景,无需人工干预。
AI是动态叙事和内容生成的强大工具,但它伴随着实际成本——无论是在计算资源还是财务开销方面。每个AI生成的语音行、实时互动或动态构建的场景都需要处理能力和API调用,其规模取决于使用情况。随着AI在游戏中的采用增长,理解和管理这些成本成为开发的关键部分。
为了平衡AI驱动的沉浸感与成本效率,我们正在设计两个版本的游戏,每个版本针对不同的用例进行了优化。
第一个版本将实时动态生成过渡场景对话,允许AI直接与玩家和团队按名称互动。此版本适用于YouTube和Twitch等平台的直播,我们将游戏会话控制为单一、独立的体验。因为它每个会话只运行一次,AI处理的成本保持可控。此版本通过允许AI生成的主持人与观众实时互动,提供完全动态的体验,从而增强参与度,证明了成本的合理性。
然而,生成AI驱动的对话并不是即时的。平均而言,生成并将一行对话转换为语音需要4到7秒,每次调用的成本为**$0.16到$0.20**。这要求我们仔细计划何时以及如何生成AI生成的内容,以避免中断玩家体验。为了最小化明显的延迟,我们设计了系统以在需要之前预加载内容或在自然暂停期间生成内容,例如在玩家被给予时间回答问题时。这确保了无缝体验,防止中断可能使玩家脱离游戏。
为了解决成本问题,第二个版本在Gig.Game中提供,设计用于私人游戏,必须支持大量会话而不会产生过多的成本。我们预先生成一组AI制作的过渡和对话片段,而不是为每个会话实时生成AI对话,确保高质量、一致的体验,同时最小化即时AI处理。这使我们能够提供可扩展、成本效益高的游戏,而不牺牲沉浸感。
这里的关键要点是AI使用必须战略性地计划。虽然实时AI驱动的体验提供无与伦比的参与度,但它们最适合受控的、单实例环境,如直播。相比之下,预生成的AI内容可以实现可扩展、可重复的游戏,而不会产生持续的AI处理成本。通过利用这两种方法,我们确保AI仍然是创新的推动者,而不是成本的瓶颈,同时保持沉浸式玩家体验所需的流畅性和参与度。
随着我们继续完善我们的AI驱动叙事引擎,我们正在探索AI生成叙事体验的新应用,超越琐事游戏,包括:
我将在拉斯维加斯的AI4 2025,期待看到其他人在AI驱动的游戏开发中如何创新。我还将在套房内演示我们的AI叙事技术,展示AI如何自动化叙事生成、配音和声音工程,以增强游戏开发工作流程。
如果您对AI在游戏中的未来感兴趣,让我们联系。您认为AI在叙事中最大的影响在哪里?让我们讨论一下。