Начать бесплатно

Искусственный интеллект быстро меняет разработку игр, открывая новые способы создания, проверки и доставки контента в больших масштабах. Хотя ИИ широко используется для процедурной генерации уровней, адаптивной сложности и поведения NPC, теперь мы применяем его к чему-то гораздо более динамичному — автоматизированному повествованию и игровым нарративным опытам.

В Gig Game Corp мы разрабатываем системы на основе ИИ, которые генерируют динамический, озвученный игровой контент в реальном времени. Один из наших основных тестовых случаев — это игра «Would I Lie??», которая использует ИИ для генерации вопросов викторины, проверки их точности и синтеза реалистичных озвучек с полным набором звуковых эффектов окружающей среды и постобработки аудио. Этот подход позволяет нам создать автоматизированный конвейер контента, устраняющий необходимость в ручном написании вопросов, диалогов персонажей и записи озвучек, обеспечивая при этом неизменно высокое качество игрового опыта.

Эта статья описывает технический подход, который мы используем при создании этой системы, как мы проверяем контент, сгенерированный ИИ, и как мы применяем ИИ к звуковому инжинирингу, чтобы создать более захватывающие игровые впечатления.

Шаг 1: Генерация вопросов и нарративов с помощью ИИ

Первый шаг в конвейере — это генерация контента. Для "Would I Lie??" это означает динамическое создание вопросов викторины, возможных ответов и диалогов ведущего в игре. Вместо того чтобы вручную подбирать тысячи вопросов, мы используем GPT-4 для генерации структурированного контента в формате JSON, который затем обрабатывается и фильтруется дополнительными моделями ИИ.

Чтобы разбить это на этапы, мы следуем следующим шагам:

  1. Генерация тем – ИИ выбирает темы на основе заранее определенных уровней сложности и категорий, генерируя как реальные, так и фальшивые темы викторины.
  2. Генерация вопросов и ответов – ИИ создает вопрос с несколькими вариантами ответов на заданную тему, гарантируя, что он включает один правильный ответ и несколько правдоподобных неправильных.
  3. Форматирование структурированного вывода – ИИ структурирует сгенерированный вопрос в схему JSON, что позволяет бесшовно интегрировать его в игровой движок.

Пример сгенерированного ИИ JSON-вывода для вопроса викторины

{
  "question": "Какое историческое событие привело к первой в мире 'дипломатической войне шуток'?",
  "answers": [
    { "text": "Франко-индейская война", "isCorrect": false },
    { "text": "Толедская война 1835 года", "isCorrect": true },
    { "text": "Исландские тресковые войны 1978 года", "isCorrect": false },
    { "text": "Пингвинский договор 1962 года", "isCorrect": false }
  ],
  "difficulty": "средний",
  "category": "история"
}

Структурируя вывод в JSON, мы можем эффективно хранить, проверять и извлекать вопросы в реальном времени, обеспечивая большой, динамически генерируемый пул вопросов, который гарантирует разнообразие и возможность повторного прохождения.

Шаг 2: Проверка и фильтрация с помощью ИИ

Одной из самых критических задач в контенте, сгенерированном ИИ, является контроль качества. Хотя языковые модели способны генерировать увлекательные вопросы, они не всегда гарантируют фактическую точность, баланс или уместность формулировок. Чтобы решить эту проблему, мы применяем многоступенчатый процесс проверки:

  1. Проверка фактов для реальных вопросов – Реальные вопросы викторины, сгенерированные ИИ, проверяются вторичной моделью ИИ, обученной проверять фактическую правильность. Если вопрос не проходит порог уверенности, он помечается для проверки или отбрасывается.
  2. Обнаружение дубликатов – Мы используем алгоритмы сходства Жаккара и расстояния Левенштейна для обнаружения и фильтрации вопросов, которые слишком похожи на ранее сгенерированные. Это предотвращает избыточность и обеспечивает разнообразие набора вопросов.
  3. Регулировка сложности – ИИ оценивает, соответствует ли вопрос предполагаемому уровню сложности. Например, "сложный" вопрос должен иметь меньшую вероятность быть правильно отвеченным на основе исторических данных игроков.

Реализуя эти меры предосторожности, мы гарантируем, что только проверенные, высококачественные вопросы попадают в финальную игру.

Шаг 3: Синтезированная ИИ озвучка и генерация диалогов

После того как вопрос сгенерирован и проверен, следующий шаг — доставка его игроку через озвучки, сгенерированные ИИ. Вместо использования заранее записанного аудио мы применяем технологию преобразования текста в речь (TTS), в частности, синтез голоса на основе ИИ от ElevenLabs, чтобы оживить ведущих в игре.

Прежде чем вызвать ElevenLabs для генерации фактической речи, мы сначала выполняем отдельный проход ИИ с использованием OpenAI для создания структурированного диалога как для введения в вопрос, так и для раскрытия ответа. Этот подход гарантирует, что каждый компонент тщательно контролируется, избегая непреднамеренных отклонений, ненужных разъяснений или преждевременного раскрытия правильного ответа.

Контролируемое использование ИИ для предотвращения превышения и галлюцинаций

Чтобы поддерживать точность и структуру, мы предоставляем конкретные инструкции в каждом запросе ИИ, четко определяя:

  • Как ИИ должен начинать – Обеспечение того, чтобы ответ начинался в четком, структурированном формате с заранее определенным введением, соответствующим тону и стилю игры.
  • Как ИИ должен заканчивать – Явно инструктируя ИИ где остановиться, предотвращая "превышение", когда модель может придумывать дополнительную информацию или пытаться предугадать ответы игроков.
  • Что не должно быть включено – Ограничение ненужных деталей, таких как ранние подсказки ответов, несвязанные комментарии или спекулятивные диалоги.

Например, при генерации наррации вопроса мы структурируем запрос ИИ следующим образом:

  • Начать с увлекательного введения, которое задает тон вопросу викторины.
  • Представить варианты ответов четко, обеспечивая их нейтральность.
  • Закончить заранее определенной фразой, такой как "Как вы думаете?", чтобы предотвратить спекуляции ИИ о правильном ответе.

Аналогично, при генерации наррации раскрытия ответа, мы:

  • Начинаем с подтверждения выбора игрока и повторения вопроса, чтобы поддерживать непрерывность.
  • Четко объявляем правильный ответ, обеспечивая его фактическую подачу.
  • Заканчиваем коротким заранее определенным ответом, таким как "Вы угадали?", предотвращая дополнительные, нежелательные комментарии, сгенерированные ИИ.

Минимизация рисков галлюцинаций ИИ

Разделяя генерацию вопросов и ответов на отдельные проходы ИИ и строго определяя точки начала и окончания, мы устраняем галлюцинации ИИ, которые могли бы случайно раскрыть ответы или ввести несоответствующую информацию. Если бы мы позволили ИИ генерировать полный диалог в одном запросе, он мог бы попытаться "предугадать" исход, что привело бы к нежелательной предвзятости, несоответствиям или ненужному наполнению контента.

Каждый вопрос викторины озвучивается двумя персонажами, сгенерированными ИИ, каждый из которых имеет свой уникальный стиль голоса и личность. Их диалог генерируется динамически и следует структурированному формату.

Пример сгенерированного ИИ диалога

{
  "Conversation": [
    { "VoiceId": "2", "Dialog": "Итак, друзья! Вот ваш следующий вопрос... Какое историческое событие привело к первой в мире 'дипломатической войне шуток'?" },
    { "VoiceId": "3", "Dialog": "Ооо, я люблю хорошие войны шуток! Надеюсь, это будет связано с резиновыми цыплятами и фальшивыми договорами." },
    { "VoiceId": "2", "Dialog": "Ваши варианты... A) Франко-индейская война, B) Толедская война 1835 года, C) Исландские тресковые войны 1978 года или D) Пингвинский договор 1962 года." },
    { "VoiceId": "3", "Dialog": "Честно говоря, я хочу, чтобы это были пингвины. Эти маленькие ребята беспощадны." }
  ]
}

После того как структурированный диалог завершен, мы отправляем его в ElevenLabs для высококачественного синтеза голоса, обеспечивая четкую, увлекательную и безошибочную наррацию, которая оживляет ведущих игры, сгенерированных ИИ, при этом поддерживая строгую точность контента. Структурируя диалог, сгенерированный ИИ, в этом формате, мы устраняем необходимость в ручном написании сценариев, сохраняя при этом естественный и динамичный поток разговора.

Шаг 4: Звуковой инжиниринг и постобработка на основе ИИ

Основным фактором в создании захватывающих повествовательных впечатлений является звуковой дизайн. Чтобы сделать озвучки, сгенерированные ИИ, более аутентичными, мы применяем техники обработки аудио с использованием NAudio, включая:

  • Наложение фонового шума толпы – Добавление реакций аудитории, таких как аплодисменты, смех или напряженные шепоты.
  • Динамические голосовые эффекты – Применение реверберации, эха или искажения для соответствия различным игровым средам.
  • Фильтрация в стиле радио – Изменение диапазонов частот для имитации винтажных трансляций.
  • Автоматизация микширования аудио – Комбинирование нескольких озвучек и звуковых эффектов в реальном времени.

Особая ситуация: Обработка переходов между сценами и диалогов, не связанных с вопросами

Помимо генерации вопросов викторины и раскрытия ответов, мы также используем ИИ для создания переходов между сценами и диалогов, не связанных с вопросами, для ключевых моментов игры, таких как введение в игру, обновления счета, переходы между раундами и финальное завершение. Эти сегменты требуют другого подхода, так как они не структурированы вокруг формата вопрос-ответ, а вместо этого служат для создания сцены, вовлечения игроков и обеспечения плавного перехода между элементами игры.

Чтобы обеспечить разнообразие и возможность повторного прохождения, мы генерируем несколько версий каждой сцены с использованием OpenAI, позволяя различным взаимодействиям и изменениям тона каждый раз, когда игра запускается. Кроме того, мы программно переключаем персонажей случайным образом для каждой сцены, обеспечивая, чтобы взаимодействия казались свежими и динамичными. Например, в одном прохождении обновление счета может быть доставлено основным ведущим и соведущим, а в другом — второстепенным персонажем, таким как эксцентричный диктор, чрезмерно увлеченный продюсер или даже стажер, добавляя юмор и непредсказуемость. Рандомизируя назначения персонажей, мы создаем разнообразный спектр взаимодействий, предотвращая повторяемость диалогов и делая каждую игровую сессию уникальной.

Чтобы поддерживать структуру и предотвращать несоответствия в диалогах, мы четко определяем начало и конец каждой сцены, обеспечивая, чтобы переходы между различными сегментами были плавными. Каждый сценарий, сгенерированный ИИ, разработан для плавного соединения с предыдущими и последующими диалоговыми сценами, предотвращая резкие или неестественные изменения в разговоре. Мы используем комбинацию предопределенных маркеров начала/конца и ограничений, специфичных для сцены, чтобы гарантировать, что контент, сгенерированный ИИ, остается в рамках предполагаемого нарративного потока.

После того как сценарии завершены, так же как и в процессе генерации вопросов, они также синтезируются с использованием технологии голосового синтеза ElevenLabs и смешиваются с окружающими звуковыми эффектами и аудиопереходами для повышения погружения и различения между сценами. Например, завершающая последовательность будет иметь наложение аплодисментов толпы, чтобы имитировать энергию живой аудитории, усиливая завершение игры. Между тем, сцена за кулисами перед шоу будет иметь примененный телефонный фильтр к аудио, слышимо отличая предвступительный диалог от самого игрового шоу. Эти звуковые эффекты и техники обработки помогают создать более увлекательный и кинематографический опыт, делая каждую сцену уникальной и усиливая общее качество производства.

Наш план по расширению возможностей звукового дизайна на основе ИИ в будущем

В будущем мы планируем расширить наши инструменты звукового дизайна на основе ИИ, разработав большую библиотеку звуковых эффектов и дополнительные аудиофильтры, которые ИИ сможет применять динамически в реальном времени. Это позволит системе регулировать аудиоэффекты в зависимости от сцены, будь то добавление эха в пустой комнате или наложение звуков шторма для драматического эффекта.

Мы также планируем запустить канал старинного радио с автоматизированными историями, который будет использовать эти инструменты для создания автоматизированных аудиодрам ужасов и научной фантастики. Они будут служить как технической демонстрацией наших возможностей повествования на основе ИИ, так и новой формой развлечения, демонстрируя, как ИИ может динамически генерировать истории, диалоги и полностью смешанные звуковые пейзажи без вмешательства человека.

Последнее соображение: Использование ИИ и эффективность затрат

ИИ — это мощный инструмент для динамического повествования и генерации контента, но он имеет реальные затраты — как в плане вычислительных ресурсов, так и финансовых накладных расходов. Каждая сгенерированная ИИ голосовая линия, взаимодействие в реальном времени или динамически сконструированная сцена требует вычислительной мощности и вызовов API, которые масштабируются в зависимости от использования. По мере роста использования ИИ в играх понимание и управление этими затратами становится критически важной частью разработки.

Чтобы сбалансировать погружение на основе ИИ с эффективностью затрат, мы разрабатываем две версии этой игры, каждая из которых оптимизирована для различных случаев использования.

Первая версия будет динамически генерировать диалоги переходных сцен в реальном времени, позволяя ИИ взаимодействовать напрямую с игроками и командами по имени. Эта версия предназначена для живых трансляций на платформах, таких как YouTube и Twitch, где мы контролируем игровую сессию как единственное, уникальное событие. Поскольку она запускается только один раз за сессию, стоимость обработки ИИ остается управляемой. Эта версия повышает вовлеченность, позволяя ведущим, сгенерированным ИИ, взаимодействовать с аудиторией в реальном времени, предоставляя полностью динамичный опыт, который оправдывает затраты.

Однако генерация диалогов на основе ИИ не является мгновенной. В среднем, требуется от 4 до 7 секунд, чтобы сгенерировать и преобразовать строку диалога в речь, при стоимости $0.16 до $0.20 за вызов. Это потребовало от нас тщательно планировать, когда и как создается контент, сгенерированный ИИ, чтобы избежать нарушения игрового опыта. Чтобы минимизировать заметные задержки, мы разработали нашу систему так, чтобы предварительно загружать контент до того, как он понадобится, или генерировать его во время естественных пауз, таких как время, предоставляемое игрокам для ответа на вопрос. Это обеспечивает бесшовный опыт, предотвращая прерывания, которые могли бы вывести игроков из игры.

Чтобы решить проблемы с затратами, вторая версия, представленная в Gig.Game, предназначена для частной игры и должна поддерживать большой объем сессий без чрезмерных затрат. Вместо генерации диалогов на основе ИИ в реальном времени для каждой сессии, мы предварительно генерируем набор переходов и диалоговых сегментов, созданных ИИ, обеспечивая высококачественный, последовательный опыт при минимизации обработки ИИ на лету. Это позволяет нам предлагать масштабируемый, экономически эффективный игровой процесс без ущерба для погружения.

Ключевой вывод здесь заключается в том, что использование ИИ должно быть стратегически спланировано. Хотя опыты на основе ИИ в реальном времени обеспечивают непревзойденную вовлеченность, они лучше всего подходят для контролируемых, одноразовых сред, таких как живые трансляции. В то время как предварительно сгенерированный контент на основе ИИ позволяет масштабируемый, повторяемый игровой процесс без постоянных затрат на обработку ИИ. Используя оба подхода, мы гарантируем, что ИИ остается катализатором инноваций, а не узким местом затрат, сохраняя при этом плавность и вовлеченность, необходимые для погруженного игрового опыта.

AI4 2025: Демонстрация повествования на основе ИИ в действии

По мере того как мы продолжаем совершенствовать наш движок повествования на основе ИИ, мы исследуем новые приложения для сгенерированных ИИ нарративных опытов за пределами викторин, включая:

  • Автоматизированная интерактивная фантастика – Сгенерированные ИИ разветвляющиеся нарративы, которые меняются в зависимости от выбора игрока.
  • Озвучка игр, управляемая ИИ – Динамические NPC, которые реагируют в реальном времени на поведение игрока.
  • Живые игровые события, управляемые ИИ – Внутриигровые истории, которые автоматически развиваются с помощью сгенерированных ИИ диалогов и аудио.

Я буду на AI4 2025 в Лас-Вегасе, где с нетерпением жду, как другие внедряют инновации в разработке игр на основе ИИ. Я также буду проводить демонстрации нашего повествовательного технологии на основе ИИ в номере, демонстрируя, как ИИ может автоматизировать генерацию нарративов, озвучку и звуковой инжиниринг таким образом, чтобы улучшить рабочие процессы разработки игр.

Если вас интересует будущее ИИ в играх, давайте свяжемся. Где, по вашему мнению, ИИ окажет наибольшее влияние на повествование? Давайте обсудим.

Предыдущая статья

Будущее игровых шоу здесь – и вы приглашены!