무료 시작

인공지능은 게임 개발을 빠르게 변화시키고 있으며, 대규모로 콘텐츠를 생성, 검증 및 제공하는 새로운 방법을 가능하게 하고 있습니다. AI는 절차적 레벨 생성, 적응형 난이도 및 NPC 행동에 널리 사용되어 왔지만, 이제는 훨씬 더 역동적인 것—자동화된 스토리텔링과 게임 주도 내러티브 경험에 적용하고 있습니다.

Gig Game Corp에서는 실시간으로 동적, 음성 연기된 게임 콘텐츠를 생성하는 AI 기반 시스템을 개발하고 있습니다. 이를 위한 주요 테스트 사례 중 하나는 AI를 사용하여 퀴즈 질문을 생성하고, 정확성을 검증하며, 환경 음향 효과와 오디오 후처리가 포함된 현실적인 음성 오버를 합성하는 게임인 **“Would I Lie??”**입니다. 이 접근 방식은 질문을 수동으로 스크립팅하고, 캐릭터 대사를 작성하고, 음성 오버를 녹음할 필요를 제거하면서 일관되게 높은 품질의 플레이어 경험을 보장하는 자동화된 콘텐츠 파이프라인을 만들 수 있게 합니다.

이 기사는 이 시스템을 구축하는 데 사용하는 기술적 접근 방식, AI 생성 콘텐츠를 검증하는 방법, 그리고 더 몰입감 있는 게임 경험을 창출하기 위해 사운드 엔지니어링에 AI를 적용하는 방법을 설명합니다.

1단계: AI 생성 질문 및 내러티브 생성

파이프라인의 첫 번째 단계는 콘텐츠 생성입니다. "Would I Lie??"의 경우, 이는 퀴즈 질문, 가능한 답변 및 게임 내 호스트 대화를 동적으로 생성하는 것을 의미합니다. 수천 개의 질문을 수동으로 큐레이팅하는 대신, 우리는 GPT-4를 사용하여 JSON 형식으로 구조화된 콘텐츠를 생성하고, 추가 AI 모델에 의해 처리 및 필터링됩니다.

이를 세분화하기 위해 다음 단계를 따릅니다:

  1. 주제 생성 – AI는 사전 정의된 난이도 수준과 카테고리를 기반으로 주제를 선택하여 실제 및 가짜 퀴즈 주제를 생성합니다.
  2. 질문 및 답변 생성 – AI는 주어진 주제를 기반으로 다지선다형 질문을 생성하여 하나의 정답과 여러 개의 그럴듯한 오답을 포함하도록 합니다.
  3. 구조화된 출력 형식화 – AI는 생성된 질문을 게임 엔진에 원활하게 통합할 수 있는 JSON 스키마로 구조화합니다.

퀴즈 질문에 대한 AI 생성 JSON 출력 예시

{
  "question": "세계 최초의 '외교적 장난 전쟁'을 초래한 역사적 사건은 무엇입니까?",
  "answers": [
    { "text": "프렌치 인디언 전쟁", "isCorrect": false },
    { "text": "1835년 톨레도 전쟁", "isCorrect": true },
    { "text": "1978년 아이슬란드 대구 전쟁", "isCorrect": false },
    { "text": "1962년 펭귄 조약", "isCorrect": false }
  ],
  "difficulty": "medium",
  "category": "history"
}

JSON으로 출력을 구조화함으로써, 우리는 실시간으로 질문을 효율적으로 저장, 검증 및 검색할 수 있으며, 다양성과 재생 가능성을 보장하는 대규모, 동적으로 생성된 질문 풀을 가능하게 합니다.

2단계: AI 기반 검증 및 필터링

AI 생성 콘텐츠에서 가장 중요한 과제 중 하나는 품질 관리입니다. 언어 모델은 매력적인 질문을 생성하는 데 매우 능숙하지만, 항상 사실적 정확성, 균형 또는 적절한 표현을 보장하지는 않습니다. 이를 해결하기 위해, 우리는 다단계 검증 프로세스를 적용합니다:

  1. 실제 질문에 대한 사실 확인 – AI 생성 실제 퀴즈 질문은 사실적 정확성을 검증하도록 훈련된 보조 AI 모델에 의해 검증됩니다. 질문이 신뢰 임계값을 통과하지 못하면 검토를 위해 플래그가 지정되거나 폐기됩니다.
  2. 중복 감지 – 우리는 자카드 유사도 및 레벤슈타인 거리 알고리즘을 사용하여 이전에 생성된 질문과 너무 유사한 질문을 감지하고 필터링합니다. 이는 중복을 방지하고 다양한 질문 세트를 보장합니다.
  3. 난이도 조정 – AI는 질문이 의도된 난이도 수준과 일치하는지 평가합니다. 예를 들어, "어려운" 질문은 역사적 플레이어 데이터를 기반으로 정답을 맞출 확률이 낮아야 합니다.

이러한 안전 장치를 구현함으로써, 우리는 검증된 고품질 질문만 최종 게임에 포함되도록 보장합니다.

3단계: AI 합성 음성 연기 및 대화 생성

질문이 생성되고 검증되면, 다음 단계는 AI 생성 음성 오버를 통해 플레이어에게 전달하는 것입니다. 사전 녹음된 오디오를 사용하는 대신, 우리는 텍스트-음성 변환(TTS) 기술, 특히 ElevenLabs의 AI 기반 음성 합성을 사용하여 게임 내 호스트를 생동감 있게 만듭니다.

실제 음성을 생성하기 전에, 우리는 먼저 OpenAI를 사용하여 별도의 AI 패스를 수행하여 질문 소개답변 공개를 위한 구조화된 대화를 생성합니다. 이 접근 방식은 각 구성 요소가 신중하게 제어되도록 하여, 의도하지 않은 편차, 불필요한 설명 또는 정답의 조기 공개를 방지합니다.

과잉 실행 및 환각 방지를 위한 제어된 AI 프롬프트

정확성과 구조를 유지하기 위해, 우리는 각 AI 프롬프트에 특정 지침을 제공하여 명확하게 정의합니다:

  • AI가 시작해야 하는 방법 – 응답이 게임의 톤과 스타일에 맞는 사전 정의된 소개와 함께 명확하고 구조화된 형식으로 시작되도록 보장합니다.
  • AI가 끝내야 하는 방법 – AI가 어디에서 멈춰야 하는지 명시적으로 지시하여, 모델이 추가 정보를 발명하거나 플레이어 응답을 예측하려고 시도하는 "과잉 실행"을 방지합니다.
  • 포함되지 말아야 할 것 – 조기 답변 힌트, 관련 없는 논평 또는 추측 대화와 같은 불필요한 세부 정보를 제한합니다.

예를 들어, 질문 내레이션을 생성할 때, 우리는 AI 프롬프트를 다음과 같이 구조화합니다:

  • 퀴즈 질문의 톤을 설정하는 흥미로운 소개로 시작합니다.
  • 다지선다형 옵션을 명확하게 제시하여 중립성을 유지합니다.
  • AI가 정답을 추측하지 않도록 **"어떻게 생각하세요?"**와 같은 사전 정의된 문구로 끝냅니다.

마찬가지로, 답변 공개 내레이션을 생성할 때, 우리는:

  • 플레이어의 선택을 재확인하고 질문을 다시 진술하여 연속성을 유지합니다.
  • 정답을 명확하게 발표하여 사실적으로 전달합니다.
  • **"맞췄나요?"**와 같은 짧은 사전 정의된 응답으로 끝내어 추가적인, 원치 않는 AI 생성 논평을 방지합니다.

AI 환각 위험 최소화

질문과 답변 생성을 별도의 AI 패스로 분할하고 시작 및 종료 지점을 엄격하게 정의함으로써, 우리는 정답을 무심코 공개하거나 관련 없는 정보를 도입할 수 있는 AI 환각을 제거합니다. AI가 한 번의 요청으로 전체 대화를 생성하도록 허용하면, 결과를 "예측"하려고 시도하여 원치 않는 편향, 불일치 또는 불필요한 필러 콘텐츠로 이어질 수 있습니다.

각 퀴즈 질문은 두 명의 AI 생성 호스트 캐릭터에 의해 내레이션되며, 각각 독특한 음성 스타일과 개성을 가지고 있습니다. 그들의 대화는 동적으로 생성되며 구조화된 형식을 따릅니다.

AI 생성 대화 예시

{
  "Conversation": [
    { "VoiceId": "2", "Dialog": "자, 여러분! 다음 질문입니다... 세계 최초의 '외교적 장난 전쟁'을 초래한 역사적 사건은 무엇입니까?" },
    { "VoiceId": "3", "Dialog": "오오, 좋은 장난 전쟁을 좋아합니다! 이건 고무 닭과 가짜 조약이 포함되어야 합니다." },
    { "VoiceId": "2", "Dialog": "옵션은... A) 프렌치 인디언 전쟁, B) 1835년 톨레도 전쟁, C) 1978년 아이슬란드 대구 전쟁, 또는 D) 1962년 펭귄 조약입니다." },
    { "VoiceId": "3", "Dialog": "솔직히, 펭귄이었으면 좋겠어요. 그 작은 녀석들은 무자비하죠." }
  ]
}

구조화된 대화가 완료되면, 우리는 ElevenLabs에 고품질 음성 합성을 요청하여, 게임의 AI 생성 호스트를 생동감 있게 만들고 엄격한 콘텐츠 정확성을 유지하면서 명확하고 매력적이며 오류 없는 내레이션을 보장합니다. AI 생성 대화를 이 형식으로 구조화함으로써, 우리는 수동 스크립팅의 필요성을 제거하면서 자연스럽고 역동적인 대화 흐름을 유지합니다.

4단계: AI 기반 사운드 엔지니어링 및 후처리

몰입형 스토리텔링 경험을 창출하는 주요 요소는 사운드 디자인입니다. AI 생성 음성 오버를 더 진짜처럼 느끼게 하기 위해, 우리는 NAudio를 사용하여 다음을 포함한 오디오 처리 기술을 적용합니다:

  • 배경 군중 소음 오버레이 – 박수, 웃음 또는 긴장된 웅성거림과 같은 관객 반응 추가.
  • 동적 음성 효과 – 다양한 게임 내 환경에 맞게 리버브, 에코 또는 왜곡 적용.
  • 라디오 스타일 필터링 – 빈티지 방송을 시뮬레이션하기 위해 주파수 범위 수정.
  • 오디오 믹싱 자동화 – 실시간으로 여러 음성 오버와 음향 효과 결합.

특별 상황: 장면 전환 및 비질문 대화 처리

퀴즈 질문과 답변 공개를 생성하는 것 외에도, 우리는 AI를 사용하여 게임 소개, 점수 업데이트, 라운드 전환 및 최종 마무리와 같은 주요 게임 순간을 위한 장면 전환 및 비질문 대화를 생성합니다. 이러한 세그먼트는 질문과 답변 형식에 구조화되지 않고, 대신 무대를 설정하고, 플레이어를 참여시키며, 게임 플레이 요소 간의 원활한 흐름을 제공하는 역할을 합니다.

다양성과 재생 가능성을 보장하기 위해, 우리는 OpenAI를 사용하여 각 장면의 여러 버전을 생성하여, 게임이 플레이될 때마다 다른 상호작용과 톤 변화를 허용합니다. 또한, 우리는 각 장면마다 프로그램적으로 캐릭터를 무작위로 교체하여 상호작용이 신선하고 역동적으로 느껴지도록 합니다. 예를 들어, 한 플레이스루에서는 메인 호스트와 공동 호스트가 점수 업데이트를 전달할 수 있지만, 다른 경우에는 기발한 아나운서, 열정적인 프로듀서 또는 심지어 인턴과 같은 보조 캐릭터가 맡아 유머와 예측 불가능성을 추가할 수 있습니다. 캐릭터 할당을 무작위화함으로써, 우리는 다양한 상호작용 범위를 생성하여 대화가 반복되지 않도록 하고 각 게임 세션을 독특하게 만듭니다.

구조를 유지하고 대화 불일치를 방지하기 위해, 우리는 각 장면의 시작과 끝을 명확하게 정의하여, 서로 다른 세그먼트 간의 전환이 원활하도록 보장합니다. 각 AI 생성 스크립트는 이전 및 다음 대화 장면과 매끄럽게 연결되도록 설계되어, 대화의 갑작스럽거나 부자연스러운 전환을 방지합니다. 우리는 사전 정의된 인트로/아웃트로 마커장면별 제약 조건을 결합하여 AI 생성 콘텐츠가 의도된 내러티브 흐름의 범위 내에 머물도록 보장합니다.

스크립트가 완료되면, 질문 생성 프로세스와 마찬가지로, ElevenLabs 음성 기술을 사용하여 합성되고 주변 음향 효과 및 오디오 전환과 혼합되어 몰입감을 높이고 장면 간의 차이를 구분합니다. 예를 들어, 엔딩 시퀀스는 게임의 결론을 강화하기 위해 라이브 관중의 에너지를 시뮬레이션하는 군중 환호 오버레이를 가질 것입니다. 한편, 프리쇼 백스테이지 장면은 메인 게임 쇼 자체와 사전 소개 대화를 청각적으로 구분하기 위해 전화 필터 패스가 적용된 오디오를 가질 것입니다. 이러한 음향 효과 및 처리 기술은 더 매력적이고 영화적인 경험을 창출하여 각 장면이 독특하게 느껴지고 전체 제작 품질을 강화합니다.

미래에 AI 사운드 디자인 기능 확장 계획

앞으로, 우리는 더 큰 음향 효과 라이브러리와 AI가 실시간으로 동적으로 적용할 수 있는 추가 오디오 필터를 개발하여 AI 기반 사운드 디자인 도구를 확장할 계획입니다. 이를 통해 시스템이 장면에 따라 오디오 효과를 조정할 수 있게 되어, 빈 방에서의 에코 추가나 극적인 효과를 위한 폭풍 소리 오버레이 등 다양한 장면에 맞게 오디오 효과를 조정할 수 있습니다.

또한, 우리는 이러한 도구를 사용하여 자동화된 공포 및 SF 오디오 드라마를 생성하는 AI 생성 구식 라디오 스토리텔링 채널을 출시할 계획입니다. 이는 우리의 AI 스토리텔링 능력의 기술적 시연과 인간의 개입 없이 이야기, 대화 및 완전히 혼합된 사운드스케이프를 동적으로 생성하는 새로운 형태의 엔터테인먼트를 제공할 것입니다.

마지막 고려 사항: AI 사용 및 비용 효율성

AI는 동적 스토리텔링 및 콘텐츠 생성을 위한 강력한 도구이지만, 컴퓨팅 자원 및 재정적 오버헤드 측면에서 실제 비용이 수반됩니다. 각 AI 생성 음성 라인, 실시간 상호작용 또는 동적으로 구성된 장면은 처리 능력 및 API 호출을 필요로 하며, 이는 사용량에 따라 확장됩니다. 게임에서 AI 채택이 증가함에 따라, 이러한 비용을 이해하고 관리하는 것이 개발의 중요한 부분이 됩니다.

AI 기반 몰입감과 비용 효율성을 균형 있게 유지하기 위해, 우리는 이 게임의 두 가지 버전을 설계하고 있으며, 각각 다른 사용 사례에 최적화되어 있습니다.

첫 번째 버전은 실시간으로 전환 장면 대화를 동적으로 생성하여 AI가 이름으로 플레이어 및 팀과 직접 상호작용할 수 있게 합니다. 이 버전은 YouTube 및 Twitch와 같은 플랫폼에서의 라이브 방송을 위해 설계되었으며, 게임 세션을 단일, 고립된 경험으로 제어합니다. 세션당 한 번만 실행되기 때문에, AI 처리 비용은 관리 가능한 수준으로 유지됩니다. 이 버전은 AI 생성 호스트가 실시간으로 관객과 상호작용할 수 있게 하여, 비용을 정당화하는 완전히 동적인 경험을 제공합니다.

그러나 AI 기반 대화를 생성하는 것은 즉각적이지 않습니다. 평균적으로, 대화를 생성하고 음성으로 변환하는 데 4~7초가 소요되며, 호출당 $0.16~$0.20의 비용이 발생합니다. 이는 플레이어 경험을 방해하지 않기 위해 AI 생성 콘텐츠가 생성되는 시점과 방법을 신중하게 계획해야 했습니다. 눈에 띄는 지연을 최소화하기 위해, 우리는 시스템이 필요하기 전에 콘텐츠를 미리 로드하거나 플레이어가 질문에 답할 시간을 주는 자연스러운 일시정지 동안 생성하도록 설계했습니다. 이는 플레이어를 게임에서 벗어나게 할 수 있는 중단을 방지하여 원활한 경험을 보장합니다.

비용 문제를 해결하기 위해, Gig.Game 내에서 제공되는 두 번째 버전은 개인 게임 플레이를 위해 설계되었으며, 과도한 비용 없이 많은 세션을 지원해야 합니다. 각 세션에 대해 실시간 AI 대화를 생성하는 대신, 우리는 AI 제작 전환 및 대화 세그먼트 세트를 사전 생성하여, 고품질, 일관된 경험을 보장하면서 즉석 AI 처리를 최소화합니다. 이를 통해 몰입감을 희생하지 않고 확장 가능하고 비용 효율적인 게임 플레이를 제공할 수 있습니다.

여기서의 핵심은 AI 사용을 전략적으로 계획해야 한다는 것입니다. 실시간 AI 기반 경험은 비할 데 없는 참여를 제공하지만, 라이브 방송과 같은 통제된 단일 인스턴스 환경에 가장 적합합니다. 반면, 사전 생성된 AI 콘텐츠확장 가능하고 반복 가능한 게임 플레이를 가능하게 하여 지속적인 AI 처리 비용을 발생시키지 않습니다. 두 가지 접근 방식을 모두 활용함으로써, 우리는 AI가 혁신의 촉진자가 되도록 보장하고, 비용의 병목 현상이 되지 않도록 하면서, 몰입감 있는 플레이어 경험에 필요한 유동성과 참여를 유지합니다.

AI4 2025: AI 스토리텔링의 실전 시연

AI 기반 스토리텔링 엔진을 계속 정제하면서, 우리는 퀴즈 게임을 넘어 AI 생성 내러티브 경험의 새로운 응용을 탐구하고 있습니다:

  • 자동화된 인터랙티브 픽션 – 플레이어 선택에 따라 변경되는 AI 생성 분기 내러티브.
  • AI 지시 게임 음성 오버 – 플레이어 행동에 실시간으로 반응하는 동적 NPC.
  • AI 기반 라이브 게임 이벤트 – AI 생성 대화 및 오디오와 함께 자동으로 발전하는 게임 내 이야기.

저는 라스베이거스에서 열리는 AI4 2025에 참석하여 AI 기반 게임 개발에서 다른 사람들이 어떻게 혁신하고 있는지 볼 수 있기를 기대합니다. 또한, AI 스토리텔링 기술을 시연하는 인스위트 데모를 제공하여 AI가 내러티브 생성, 음성 연기 및 사운드 엔지니어링을 자동화하여 게임 개발 워크플로를 향상시키는 방법을 보여줄 것입니다.

게임에서 AI의 미래에 관심이 있다면, 함께 이야기해 봅시다. AI가 스토리텔링에 가장 큰 영향을 미칠 수 있는 곳은 어디라고 생각하십니까? 함께 논의해 봅시다.

이전 기사

게임 쇼의 미래가 여기에 있습니다 – 그리고 당신을 초대합니다!