
Künstliche Intelligenz verändert die Spieleentwicklung rasant und ermöglicht neue Wege zur Generierung, Validierung und Bereitstellung von Inhalten in großem Maßstab. Während KI bereits weit verbreitet für die prozedurale Level-Generierung, adaptive Schwierigkeitsgrade und NPC-Verhalten eingesetzt wird, wenden wir sie nun auf etwas viel Dynamischeres an—automatisierte Erzählungen und spielgetriebene narrative Erlebnisse.
Bei Gig Game Corp entwickeln wir KI-gesteuerte Systeme, die dynamische, sprachgesteuerte Spielinhalte in Echtzeit generieren. Einer unserer primären Testfälle dafür ist „Would I Lie??“, ein Spiel, das KI nutzt, um Quizfragen zu generieren, deren Genauigkeit zu validieren und realistische Sprachübertragungen zu synthetisieren, komplett mit Umgebungsgeräuschen und Audio-Nachbearbeitung. Dieser Ansatz ermöglicht es uns, eine automatisierte Content-Pipeline zu schaffen, die das manuelle Skripten von Fragen, das Schreiben von Charakterdialogen und das Aufnehmen von Sprachübertragungen überflüssig macht, während gleichzeitig ein durchgängig hochwertiges Spielerlebnis gewährleistet wird.
Dieser Artikel skizziert den technischen Ansatz, den wir beim Aufbau dieses Systems verfolgen, wie wir KI-generierte Inhalte validieren und wie wir KI auf Sound Engineering anwenden, um immersivere Spielerlebnisse zu schaffen.
Der erste Schritt in der Pipeline ist die Inhaltserstellung. Für „Would I Lie??“ bedeutet dies, dynamisch Quizfragen, mögliche Antworten und In-Game-Host-Dialoge zu erstellen. Anstatt Tausende von Fragen manuell zu kuratieren, verwenden wir GPT-4, um strukturierte Inhalte in einem JSON-Format zu generieren, die dann von zusätzlichen KI-Modellen verarbeitet und gefiltert werden.
Um dies aufzuschlüsseln, folgen wir diesen Schritten:
{
"question": "Welches historische Ereignis führte zum weltweit ersten 'diplomatischen Streichkrieg'?",
"answers": [
{ "text": "Der Französisch-Indische Krieg", "isCorrect": false },
{ "text": "Der Toledo-Krieg von 1835", "isCorrect": true },
{ "text": "Die Island-Kabeljaukriege von 1978", "isCorrect": false },
{ "text": "Der Pinguin-Vertrag von 1962", "isCorrect": false }
],
"difficulty": "mittel",
"category": "Geschichte"
}
Durch die Strukturierung der Ausgabe in JSON können wir Fragen effizient speichern, validieren und abrufen, was einen großen, dynamisch generierten Fragenpool ermöglicht, der Vielfalt und Wiederspielbarkeit sicherstellt.
Eine der kritischsten Herausforderungen bei KI-generierten Inhalten ist die Qualitätskontrolle. Während Sprachmodelle sehr fähig sind, ansprechende Fragen zu generieren, garantieren sie nicht immer faktische Genauigkeit, Ausgewogenheit oder angemessene Formulierungen. Um dies zu adressieren, wenden wir einen mehrstufigen Validierungsprozess an:
Durch die Implementierung dieser Schutzmaßnahmen stellen wir sicher, dass nur validierte, qualitativ hochwertige Fragen ins endgültige Spiel gelangen.
Sobald eine Frage generiert und validiert ist, besteht der nächste Schritt darin, sie dem Spieler durch KI-generierte Sprachübertragungen zu liefern. Anstatt vorab aufgezeichnetes Audio zu verwenden, setzen wir Text-to-Speech (TTS)-Technologie ein, insbesondere die KI-gesteuerte Sprachsynthese von ElevenLabs, um die In-Game-Hosts zum Leben zu erwecken.
Bevor wir ElevenLabs aufrufen, um die tatsächliche Sprache zu generieren, führen wir zunächst einen separaten KI-Durchlauf mit OpenAI durch, um strukturierten Dialog sowohl für die Frageeinführung als auch die Antwortenthüllung zu erstellen. Dieser Ansatz stellt sicher, dass jede Komponente sorgfältig kontrolliert wird, um unbeabsichtigte Abweichungen, unnötige Ausführungen oder frühzeitige Offenlegungen der richtigen Antwort zu vermeiden.
Um Genauigkeit und Struktur zu gewährleisten, geben wir spezifische Anweisungen in jedem KI-Prompt, die klar definieren:
Zum Beispiel, wenn wir Fragen-Erzählung generieren, strukturieren wir den KI-Prompt wie folgt:
Ähnlich, wenn wir Antwortenthüllungserzählung generieren, tun wir Folgendes:
Durch Aufteilung der Frage- und Antwortgenerierung in separate KI-Durchläufe und strikte Definition von Start- und Endpunkten eliminieren wir KI-Halluzinationen, die unbeabsichtigt Antworten offenbaren oder irrelevante Informationen einführen könnten. Wenn wir der KI erlauben würden, den vollständigen Dialog in einer Anfrage zu generieren, könnte sie versuchen, das Ergebnis „vorherzusehen“, was zu unerwünschter Voreingenommenheit, Inkonsistenzen oder unnötigem Füllmaterial führen könnte.
Jede Quizfrage wird von zwei KI-generierten Host-Charakteren erzählt, jeder mit unterschiedlichen Sprachstilen und Persönlichkeiten. Ihr Dialog wird dynamisch generiert und folgt einem strukturierten Format.
{
"Conversation": [
{ "VoiceId": "2", "Dialog": "Okay, Leute! Hier ist eure nächste Frage... Welches historische Ereignis führte zum weltweit ersten 'diplomatischen Streichkrieg'?" },
{ "VoiceId": "3", "Dialog": "Ooooh, ich liebe einen guten Streichkrieg! Das sollte Gummihühner und gefälschte Verträge beinhalten." },
{ "VoiceId": "2", "Dialog": "Eure Optionen sind... A) Der Französisch-Indische Krieg, B) Der Toledo-Krieg von 1835, C) Die Island-Kabeljaukriege von 1978 oder D) Der Pinguin-Vertrag von 1962." },
{ "VoiceId": "3", "Dialog": "Ehrlich gesagt, ich möchte, dass es die Pinguine sind. Diese kleinen Kerle sind gnadenlos." }
]
}
Sobald der strukturierte Dialog finalisiert ist, senden wir ihn an ElevenLabs für hochwertige Sprachsynthese, um eine klare, ansprechende und fehlerfreie Erzählung zu gewährleisten, die die KI-generierten Hosts des Spiels zum Leben erweckt und gleichzeitig die strikte Inhaltsgenauigkeit beibehält. Durch die Strukturierung von KI-generierten Dialogen in diesem Format eliminieren wir die Notwendigkeit für manuelles Skripten und erhalten einen natürlichen und dynamischen Gesprächsfluss.
Ein wesentlicher Faktor bei der Schaffung immersiver Erzählungserlebnisse ist das Sounddesign. Um KI-generierte Sprachübertragungen authentischer wirken zu lassen, wenden wir Audiobearbeitungstechniken mit NAudio an, darunter:
Neben der Generierung von Quizfragen und Antwortenthüllungen verwenden wir KI auch, um Szenenübergänge und Nicht-Fragen-Dialoge für wichtige Spielmomente zu erstellen, wie die Spieleinführung, Punktestandsaktualisierungen, Rundenübergänge und den abschließenden Wrap-up. Diese Segmente erfordern einen anderen Ansatz, da sie nicht um ein Frage-Antwort-Format strukturiert sind, sondern dazu dienen, die Bühne zu bereiten, Spieler zu engagieren und einen nahtlosen Fluss zwischen den Spielelementen zu gewährleisten.
Um Vielfalt und Wiederspielbarkeit sicherzustellen, generieren wir mehrere Versionen jeder Szene mit OpenAI, die bei jedem Spiel unterschiedliche Interaktionen und Tonverschiebungen ermöglichen. Zusätzlich wechseln wir programmatisch die Charaktere zufällig für jede Szene, um sicherzustellen, dass sich die Interaktionen frisch und dynamisch anfühlen. Zum Beispiel könnte in einem Durchlauf ein Punktestand-Update vom Haupt- und Co-Host geliefert werden, während in einem anderen ein sekundärer Charakter—wie ein skurriler Ansager, ein überenthusiastischer Produzent oder sogar ein Praktikant—übernimmt, was Humor und Unvorhersehbarkeit hinzufügt. Durch die Zufallszuweisung von Charakteren schaffen wir eine vielfältige Palette von Interaktionen, die verhindern, dass Dialoge repetitiv werden, und jede Spielsitzung einzigartig machen.
Um Struktur zu bewahren und Dialoginkonsistenzen zu verhindern, definieren wir klar den Anfang und das Ende jeder Szene, um sicherzustellen, dass Übergänge zwischen verschiedenen Segmenten nahtlos sind. Jedes KI-generierte Skript ist so konzipiert, dass es nahtlos mit den vorhergehenden und folgenden Dialogszenen verbunden ist, um abrupte oder unnatürliche Verschiebungen im Gespräch zu verhindern. Wir verwenden eine Kombination aus vordefinierten Intro/Outro-Markern und szenenspezifischen Einschränkungen, um sicherzustellen, dass KI-generierte Inhalte im Rahmen des beabsichtigten Erzählflusses bleiben.
Sobald die Skripte finalisiert sind, werden sie, genau wie beim Fragegenerierungsprozess, auch mit ElevenLabs-Sprachtechnologie synthetisiert und mit Umgebungsgeräuschen und Audioübergängen gemischt, um die Immersion zu erhöhen und zwischen den Szenen zu unterscheiden. Zum Beispiel wird eine Endsequenz eine Publikumsjubel-Überlagerung haben, um die Energie eines Live-Publikums zu simulieren und den Abschluss des Spiels zu verstärken. Währenddessen wird eine Vorshow-Backstage-Szene einen Telefonfilter-Pass auf das Audio angewendet haben, um den Vor-Intro-Dialog hörbar vom eigentlichen Spielshow selbst zu unterscheiden. Diese Soundeffekte und Bearbeitungstechniken helfen, ein ansprechenderes und filmischeres Erlebnis zu schaffen, das jede Szene einzigartig macht und die Gesamtproduktionsqualität verstärkt.
In Zukunft planen wir, unsere KI-gesteuerten Sounddesign-Tools zu erweitern, indem wir eine größere Soundeffektbibliothek und zusätzliche Audiofilter entwickeln, die KI dynamisch in Echtzeit anwenden kann. Dies würde es dem System ermöglichen, Audioeffekte basierend auf der Szene anzupassen, sei es das Hinzufügen von Echo in einem leeren Raum oder das Überlagern von Sturmgeräuschen für dramatische Effekte.
Wir planen auch, einen KI-generierten alten Radio-Erzählkanal zu starten, der diese Tools nutzt, um automatisierte Horror- und Sci-Fi-Audiodramen zu erstellen. Diese werden sowohl als technische Demonstration unserer KI-Erzählfähigkeiten als auch als neue Unterhaltungsform dienen, die zeigt, wie KI dynamisch Geschichten, Dialoge und vollständig gemischte Klanglandschaften ohne menschliches Eingreifen generieren kann.
KI ist ein mächtiges Werkzeug für dynamische Erzählungen und Inhaltserstellung, aber es bringt reale Kosten mit sich—sowohl in Bezug auf Rechenressourcen als auch auf finanzielle Aufwendungen. Jede KI-generierte Sprachzeile, Echtzeit-Interaktion oder dynamisch konstruierte Szene erfordert Rechenleistung und API-Aufrufe, die sich je nach Nutzung skalieren. Da die KI-Akzeptanz im Gaming wächst, wird das Verständnis und Management dieser Kosten zu einem kritischen Teil der Entwicklung.
Um KI-gesteuerte Immersion mit Kosteneffizienz in Einklang zu bringen, entwerfen wir zwei Versionen dieses Spiels, die jeweils für unterschiedliche Anwendungsfälle optimiert sind.
Die erste Version wird Übergangsszenen-Dialoge in Echtzeit dynamisch generieren, sodass KI direkt mit Spielern und Teams namentlich interagieren kann. Diese Version ist für Live-Übertragungen auf Plattformen wie YouTube und Twitch gedacht, wo wir die Spielsitzung als einzigartiges, singuläres Erlebnis steuern. Da sie nur einmal pro Sitzung läuft, bleiben die Kosten für die KI-Verarbeitung überschaubar. Diese Version erhöht das Engagement, indem KI-generierte Hosts in Echtzeit mit dem Publikum interagieren und ein vollständig dynamisches Erlebnis bieten, das die Kosten rechtfertigt.
Allerdings ist die Generierung von KI-gesteuertem Dialog nicht sofort. Im Durchschnitt dauert es zwischen 4 und 7 Sekunden, um eine Dialogzeile zu generieren und in Sprache umzuwandeln, zu Kosten von $0,16 bis $0,20 pro Aufruf. Dies erforderte, dass wir sorgfältig planen, wann und wie KI-generierte Inhalte erstellt werden, um Unterbrechungen des Spielerlebnisses zu vermeiden. Um spürbare Verzögerungen zu minimieren, haben wir unser System so konzipiert, dass es Inhalte vorlädt, bevor sie benötigt werden, oder sie während natürlicher Pausen generiert, wie wenn Spielern Zeit gegeben wird, eine Frage zu beantworten. Dies gewährleistet ein nahtloses Erlebnis und verhindert Unterbrechungen, die Spieler aus dem Spiel reißen könnten.
Um Kostenbedenken zu adressieren, ist die zweite Version, die innerhalb von Gig.Game vorgestellt wird, für privates Gameplay konzipiert und muss eine hohe Anzahl von Sitzungen ohne übermäßige Kosten unterstützen. Anstatt für jede Sitzung Echtzeit-KI-Dialoge zu generieren, generieren wir im Voraus eine Reihe von KI-erstellten Übergängen und Dialogsegmenten, um ein hochwertiges, konsistentes Erlebnis zu gewährleisten und gleichzeitig die on-the-fly KI-Verarbeitung zu minimieren. Dies ermöglicht es uns, skalierbares, kosteneffizientes Gameplay anzubieten, ohne die Immersion zu opfern.
Der Schlüssel hier ist, dass die KI-Nutzung strategisch geplant werden muss. Während Echtzeit-KI-gesteuerte Erlebnisse unvergleichliches Engagement bieten, sind sie am besten für kontrollierte, einmalige Umgebungen wie Live-Übertragungen geeignet. Im Gegensatz dazu ermöglicht vorgenerierter KI-Inhalt skalierbares, wiederholbares Gameplay, ohne laufende KI-Verarbeitungskosten zu verursachen. Durch die Nutzung beider Ansätze stellen wir sicher, dass KI ein Enabler für Innovation bleibt, anstatt ein Kostenengpass, während die Fluidität und das Engagement erhalten bleiben, die für ein immersives Spielerlebnis notwendig sind.
Während wir unsere KI-gesteuerte Erzählmaschine weiter verfeinern, erkunden wir neue Anwendungen für KI-generierte narrative Erlebnisse über Quizspiele hinaus, einschließlich:
Ich werde bei AI4 2025 in Las Vegas sein, wo ich gespannt bin, wie andere im Bereich der KI-gestützten Spieleentwicklung innovieren. Ich werde auch In-Suite-Demos unserer KI-Erzähltechnologie geben, die zeigen, wie KI Erzählgenerierung, Sprachschauspielerei und Sound Engineering automatisieren kann, um die Arbeitsabläufe der Spieleentwicklung zu verbessern.
Wenn Sie an der Zukunft der KI im Gaming interessiert sind, lassen Sie uns in Kontakt treten. Wo sehen Sie den größten Einfluss von KI auf das Erzählen von Geschichten? Lassen Sie uns diskutieren.
Die Zukunft der Spielshows ist da – und Sie sind eingeladen!
Spannende Updates für Gig Game, Open JS Library und Mobo Bingo!