
L'intelligence artificielle change rapidement le développement des jeux, permettant de nouvelles façons de générer, valider et livrer du contenu à grande échelle. Bien que l'IA ait été largement utilisée pour la génération procédurale de niveaux, la difficulté adaptative et le comportement des PNJ, nous l'appliquons maintenant à quelque chose de beaucoup plus dynamique—la narration automatisée et les expériences narratives pilotées par le jeu.
Chez Gig Game Corp, nous développons des systèmes pilotés par l'IA qui génèrent du contenu de jeu dynamique avec voix en temps réel. L'un de nos principaux cas de test pour cela est « Would I Lie?? », un jeu qui utilise l'IA pour générer des questions de trivia, valider leur exactitude et synthétiser des voix réalistes complètes avec des effets sonores environnementaux et un post-traitement audio. Cette approche nous permet de créer un pipeline de contenu automatisé qui élimine le besoin de rédiger manuellement des questions, d'écrire des dialogues de personnages et d'enregistrer des voix tout en garantissant une expérience de joueur de haute qualité constante.
Cet article décrit l'approche technique que nous adoptons pour construire ce système, comment nous validons le contenu généré par l'IA et comment nous appliquons l'IA à l'ingénierie sonore pour créer des expériences de jeu plus immersives.
La première étape du pipeline est la génération de contenu. Pour « Would I Lie?? », cela signifie créer dynamiquement des questions de trivia, des réponses possibles et des dialogues d'hôte en jeu. Au lieu de sélectionner manuellement des milliers de questions, nous utilisons GPT-4 pour générer du contenu structuré dans un format JSON, qui est ensuite traité et filtré par des modèles d'IA supplémentaires.
Pour décomposer cela, nous suivons ces étapes :
{
"question": "Quel événement historique a conduit à la première 'guerre de farces diplomatiques' au monde ?",
"answers": [
{ "text": "La guerre de la Conquête", "isCorrect": false },
{ "text": "La guerre de Toledo de 1835", "isCorrect": true },
{ "text": "Les guerres de la morue islandaise de 1978", "isCorrect": false },
{ "text": "Le traité des pingouins de 1962", "isCorrect": false }
],
"difficulty": "moyenne",
"category": "histoire"
}
En structurant la sortie en JSON, nous pouvons stocker, valider et récupérer efficacement les questions en temps réel, permettant un grand pool de questions générées dynamiquement qui assure variété et rejouabilité.
L'un des défis les plus critiques dans le contenu généré par l'IA est le contrôle de la qualité. Bien que les modèles de langage soient très capables de générer des questions engageantes, ils ne garantissent pas toujours l'exactitude factuelle, l'équilibre ou le phrasé approprié. Pour y remédier, nous appliquons un processus de validation en plusieurs étapes :
En mettant en œuvre ces garanties, nous nous assurons que seules les questions validées et de haute qualité sont intégrées dans le jeu final.
Une fois qu'une question est générée et validée, l'étape suivante est de la livrer au joueur via des voix générées par l'IA. Au lieu d'utiliser de l'audio préenregistré, nous employons la technologie de synthèse vocale (TTS), spécifiquement la synthèse vocale pilotée par l'IA d'ElevenLabs, pour donner vie aux hôtes en jeu.
Avant d'appeler ElevenLabs pour générer le discours réel, nous effectuons d'abord un passage AI séparé en utilisant OpenAI pour créer un dialogue structuré pour à la fois l'introduction de la question et la révélation de la réponse. Cette approche garantit que chaque composant est soigneusement contrôlé, évitant les déviations involontaires, les élaborations inutiles ou la divulgation précoce de la réponse correcte.
Pour maintenir l'exactitude et la structure, nous fournissons des instructions spécifiques dans chaque incitation de l'IA, définissant clairement :
Par exemple, lors de la génération de narration de question, nous structurons l'incitation de l'IA comme suit :
De même, lors de la génération de narration de révélation de réponse, nous :
En divisant la génération de questions et de réponses en passes AI séparées et en définissant strictement les points de départ et d'arrêt, nous éliminons les hallucinations de l'IA qui pourraient révéler involontairement des réponses ou introduire des informations non pertinentes. Si nous permettions à l'IA de générer le dialogue complet en une seule demande, elle pourrait tenter "d'anticiper" le résultat, entraînant des biais indésirables, des incohérences ou du contenu de remplissage inutile.
Chaque question de trivia est narrée par deux personnages hôtes générés par l'IA, chacun avec des styles vocaux et des personnalités distincts. Leur dialogue est généré dynamiquement et suit un format structuré.
{
"Conversation": [
{ "VoiceId": "2", "Dialog": "D'accord, les amis ! Voici votre prochaine question... Quel événement historique a conduit à la première 'guerre de farces diplomatiques' au monde ?" },
{ "VoiceId": "3", "Dialog": "Ooooh, j'adore une bonne guerre de farces ! Cela devrait impliquer des poulets en caoutchouc et de faux traités." },
{ "VoiceId": "2", "Dialog": "Vos options sont... A) La guerre de la Conquête, B) La guerre de Toledo de 1835, C) Les guerres de la morue islandaise de 1978, ou D) Le traité des pingouins de 1962." },
{ "VoiceId": "3", "Dialog": "Honnêtement, je veux que ce soit les pingouins. Ces petits gars sont impitoyables." }
]
}
Une fois le dialogue structuré finalisé, nous l'envoyons à ElevenLabs pour une synthèse vocale de haute qualité, garantissant une narration claire, engageante et sans erreur qui donne vie aux hôtes générés par l'IA du jeu tout en maintenant une précision stricte du contenu. En structurant le dialogue généré par l'IA de cette manière, nous éliminons le besoin de scriptage manuel tout en maintenant un flux conversationnel naturel et dynamique.
Un facteur majeur dans la création d'expériences narratives immersives est le design sonore. Pour que les voix générées par l'IA paraissent plus authentiques, nous appliquons des techniques de traitement audio en utilisant NAudio, notamment :
Au-delà de la génération de questions de trivia et de révélations de réponses, nous utilisons également l'IA pour créer des transitions de scène et des dialogues non liés aux questions pour les moments clés du jeu, tels que l'introduction du jeu, les mises à jour des scores, les transitions de round et la conclusion finale. Ces segments nécessitent une approche différente car ils ne sont pas structurés autour d'un format de question-réponse mais servent plutôt à mettre en scène, engager les joueurs et assurer un flux fluide entre les éléments de jeu.
Pour assurer la variété et la rejouabilité, nous générons plusieurs versions de chaque scène en utilisant OpenAI, permettant des interactions et des changements de ton différents à chaque fois que le jeu est joué. De plus, nous changeons de personnages de manière programmatique au hasard pour chaque scène, garantissant que les interactions semblent fraîches et dynamiques. Par exemple, lors d'une partie, une mise à jour des scores pourrait être livrée par l'hôte principal et le co-hôte, tandis que dans une autre, un personnage secondaire—comme un annonceur excentrique, un producteur trop zélé ou même un stagiaire—pourrait prendre le relais, ajoutant de l'humour et de l'imprévisibilité. En randomisant les affectations de personnages, nous créons une gamme diversifiée d'interactions, empêchant le dialogue de devenir répétitif et rendant chaque session de jeu unique.
Pour maintenir la structure et prévenir les incohérences de dialogue, nous définissons clairement le début et la fin de chaque scène, garantissant que les transitions entre les différents segments sont fluides. Chaque script généré par l'IA est conçu pour se connecter en douceur avec les scènes de dialogue précédentes et suivantes, évitant les changements de conversation brusques ou non naturels. Nous utilisons une combinaison de marqueurs d'intro/outro prédéfinis et de contraintes spécifiques à la scène pour garantir que le contenu généré par l'IA reste dans le cadre du flux narratif prévu.
Une fois les scripts finalisés, tout comme avec le processus de génération de questions, ils sont également synthétisés en utilisant la technologie vocale d'ElevenLabs et mixés avec des effets sonores ambiants et des transitions audio pour améliorer l'immersion et différencier les scènes. Par exemple, une séquence de fin aura une superposition de cris de foule pour simuler l'énergie d'un public en direct, renforçant la conclusion du jeu. Pendant ce temps, une scène de coulisses avant le spectacle aura un filtre de téléphone appliqué à l'audio, distinguant audiblement le dialogue pré-intro du jeu principal lui-même. Ces effets sonores et techniques de traitement aident à créer une expérience plus engageante et cinématographique, rendant chaque scène distincte et renforçant la qualité globale de la production.
À l'avenir, nous prévoyons d'étendre nos outils de design sonore pilotés par l'IA en développant une plus grande bibliothèque d'effets sonores et des filtres audio supplémentaires que l'IA peut appliquer dynamiquement en temps réel. Cela permettrait au système d'ajuster les effets audio en fonction de la scène, qu'il s'agisse d'ajouter de l'écho dans une pièce vide ou de superposer des sons de tempête pour un effet dramatique.
Nous prévoyons également de lancer une chaîne de narration radiophonique de style ancien générée par l'IA, qui utilisera ces outils pour créer des drames audio d'horreur et de science-fiction automatisés. Ceux-ci serviront à la fois de démonstration technique de nos capacités de narration par l'IA et de nouvelle forme de divertissement, montrant comment l'IA peut générer dynamiquement des histoires, des dialogues et des paysages sonores entièrement mixés sans intervention humaine.
L'IA est un outil puissant pour la narration dynamique et la génération de contenu, mais elle a des coûts réels—tant en termes de ressources informatiques que de frais financiers. Chaque ligne vocale générée par l'IA, interaction en temps réel ou scène construite dynamiquement nécessite de la puissance de traitement et des appels API, qui évoluent en fonction de l'utilisation. À mesure que l'adoption de l'IA dans le jeu se développe, comprendre et gérer ces coûts devient une partie critique du développement.
Pour équilibrer l'immersion pilotée par l'IA avec l'efficacité des coûts, nous concevons deux versions de ce jeu, chacune optimisée pour des cas d'utilisation différents.
La première version générera dynamiquement le dialogue de transition de scène en temps réel, permettant à l'IA d'interagir directement avec les joueurs et les équipes par leur nom. Cette version est destinée aux diffusions en direct sur des plateformes comme YouTube et Twitch, où nous contrôlons la session de jeu comme une expérience singulière et solitaire. Parce qu'elle ne fonctionne qu'une fois par session, le coût du traitement de l'IA reste gérable. Cette version améliore l'engagement en permettant aux hôtes générés par l'IA d'interagir avec le public en temps réel, offrant une expérience entièrement dynamique qui justifie le coût.
Cependant, générer un dialogue piloté par l'IA n'est pas instantané. En moyenne, il faut entre 4 et 7 secondes pour générer et convertir une ligne de dialogue en discours, à un coût de 0,16 \(à 0,20\) par appel. Cela nous a obligés à planifier soigneusement quand et comment le contenu généré par l'IA est créé pour éviter de perturber l'expérience du joueur. Pour minimiser les délais perceptibles, nous avons conçu notre système pour précharger le contenu avant qu'il ne soit nécessaire ou pour le générer pendant les pauses naturelles, comme lorsque les joueurs ont le temps de répondre à une question. Cela garantit une expérience fluide, évitant les interruptions qui pourraient sortir les joueurs du jeu.
Pour répondre aux préoccupations de coût, la deuxième version, présentée dans Gig.Game, est conçue pour un gameplay privé et doit prendre en charge un volume élevé de sessions sans coûts excessifs. Au lieu de générer un dialogue AI en temps réel pour chaque session, nous pré-générons un ensemble de transitions et de segments de dialogue conçus par l'IA, garantissant une expérience de haute qualité et cohérente tout en minimisant le traitement AI à la volée. Cela nous permet d'offrir un gameplay évolutif et rentable sans sacrifier l'immersion.
La leçon clé ici est que l'utilisation de l'IA doit être planifiée stratégiquement. Bien que les expériences dynamiques pilotées par l'IA en temps réel offrent un engagement inégalé, elles conviennent mieux aux environnements contrôlés et à instance unique comme les diffusions en direct. En revanche, le contenu AI pré-généré permet un gameplay évolutif et répétable sans encourir de coûts de traitement AI continus. En tirant parti des deux approches, nous nous assurons que l'IA reste un moteur d'innovation, plutôt qu'un goulot d'étranglement de coût, tout en maintenant la fluidité et l'engagement nécessaires pour une expérience de joueur immersive.
Alors que nous continuons à affiner notre moteur de narration piloté par l'IA, nous explorons de nouvelles applications pour les expériences narratives générées par l'IA au-delà des jeux de trivia, y compris :
Je serai à AI4 2025 à Las Vegas, où j'ai hâte de voir comment d'autres innovent dans le développement de jeux piloté par l'IA. Je donnerai également des démos en suite de notre technologie de narration par l'IA, montrant comment l'IA peut automatiser la génération de récits, le doublage et l'ingénierie sonore d'une manière qui améliore les flux de travail de développement de jeux.
Si vous êtes intéressé par l'avenir de l'IA dans le jeu, connectons-nous. Où voyez-vous l'IA avoir le plus grand impact sur la narration ? Discutons-en.
L'avenir des jeux télévisés est là – Et vous êtes invité !
Mises à jour passionnantes pour Gig Game, Open JS Library et Mobo Bingo !