Kostenlos starten

Künstliche Intelligenz verändert die Spieleentwicklung rasant und ermöglicht neue Wege zur Generierung, Validierung und Bereitstellung von Inhalten in großem Maßstab. Während KI bereits weit verbreitet für die prozedurale Level-Generierung, adaptive Schwierigkeitsgrade und NPC-Verhalten eingesetzt wird, wenden wir sie nun auf etwas viel Dynamischeres an—automatisierte Erzählungen und spielgetriebene narrative Erlebnisse.

Bei Gig Game Corp entwickeln wir KI-gesteuerte Systeme, die dynamische, sprachgesteuerte Spielinhalte in Echtzeit generieren. Einer unserer primären Testfälle dafür ist „Would I Lie??“, ein Spiel, das KI nutzt, um Quizfragen zu generieren, deren Genauigkeit zu validieren und realistische Sprachübertragungen zu synthetisieren, komplett mit Umgebungsgeräuschen und Audio-Nachbearbeitung. Dieser Ansatz ermöglicht es uns, eine automatisierte Content-Pipeline zu schaffen, die das manuelle Skripten von Fragen, das Schreiben von Charakterdialogen und das Aufnehmen von Sprachübertragungen überflüssig macht, während gleichzeitig ein durchgängig hochwertiges Spielerlebnis gewährleistet wird.

Dieser Artikel skizziert den technischen Ansatz, den wir beim Aufbau dieses Systems verfolgen, wie wir KI-generierte Inhalte validieren und wie wir KI auf Sound Engineering anwenden, um immersivere Spielerlebnisse zu schaffen.

Schritt 1: KI-generierte Frage- und Erzählungserstellung

Der erste Schritt in der Pipeline ist die Inhaltserstellung. Für „Would I Lie??“ bedeutet dies, dynamisch Quizfragen, mögliche Antworten und In-Game-Host-Dialoge zu erstellen. Anstatt Tausende von Fragen manuell zu kuratieren, verwenden wir GPT-4, um strukturierte Inhalte in einem JSON-Format zu generieren, die dann von zusätzlichen KI-Modellen verarbeitet und gefiltert werden.

Um dies aufzuschlüsseln, folgen wir diesen Schritten:

  1. Themen-Generierung – KI wählt Themen basierend auf vordefinierten Schwierigkeitsgraden und Kategorien aus und generiert sowohl echte als auch gefälschte Quizthemen.
  2. Fragen- und Antwortgenerierung – Die KI erstellt eine Multiple-Choice-Frage basierend auf einem gegebenen Thema und stellt sicher, dass sie eine richtige Antwort und mehrere plausible falsche enthält.
  3. Strukturierte Ausgabeformatierung – Die KI strukturiert die generierte Frage in ein JSON-Schema, das eine nahtlose Integration in die Spiel-Engine ermöglicht.

Beispiel für eine KI-generierte JSON-Ausgabe für eine Quizfrage

{
  "question": "Welches historische Ereignis führte zum weltweit ersten 'diplomatischen Streichkrieg'?",
  "answers": [
    { "text": "Der Französisch-Indische Krieg", "isCorrect": false },
    { "text": "Der Toledo-Krieg von 1835", "isCorrect": true },
    { "text": "Die Island-Kabeljaukriege von 1978", "isCorrect": false },
    { "text": "Der Pinguin-Vertrag von 1962", "isCorrect": false }
  ],
  "difficulty": "mittel",
  "category": "Geschichte"
}

Durch die Strukturierung der Ausgabe in JSON können wir Fragen effizient speichern, validieren und abrufen, was einen großen, dynamisch generierten Fragenpool ermöglicht, der Vielfalt und Wiederspielbarkeit sicherstellt.

Schritt 2: KI-gesteuerte Validierung & Filterung

Eine der kritischsten Herausforderungen bei KI-generierten Inhalten ist die Qualitätskontrolle. Während Sprachmodelle sehr fähig sind, ansprechende Fragen zu generieren, garantieren sie nicht immer faktische Genauigkeit, Ausgewogenheit oder angemessene Formulierungen. Um dies zu adressieren, wenden wir einen mehrstufigen Validierungsprozess an:

  1. Faktenprüfung für echte Fragen – KI-generierte echte Quizfragen werden gegen ein sekundäres KI-Modell validiert, das auf die Überprüfung faktischer Korrektheit trainiert ist. Wenn eine Frage einen Vertrauensschwellenwert nicht erreicht, wird sie zur Überprüfung markiert oder verworfen.
  2. Duplikaterkennung – Wir verwenden Jaccard-Ähnlichkeit und Levenshtein-Distanz-Algorithmen, um Fragen zu erkennen und herauszufiltern, die zu ähnlich zu zuvor generierten sind. Dies verhindert Redundanz und stellt ein vielfältiges Fragenset sicher.
  3. Schwierigkeitsanpassung – KI bewertet, ob die Frage mit dem beabsichtigten Schwierigkeitsgrad übereinstimmt. Zum Beispiel sollte eine „schwere“ Frage eine geringere Wahrscheinlichkeit haben, basierend auf historischen Spieler-Daten korrekt beantwortet zu werden.

Durch die Implementierung dieser Schutzmaßnahmen stellen wir sicher, dass nur validierte, qualitativ hochwertige Fragen ins endgültige Spiel gelangen.

Schritt 3: KI-synthetisierte Sprachschauspielerei & Dialoggenerierung

Sobald eine Frage generiert und validiert ist, besteht der nächste Schritt darin, sie dem Spieler durch KI-generierte Sprachübertragungen zu liefern. Anstatt vorab aufgezeichnetes Audio zu verwenden, setzen wir Text-to-Speech (TTS)-Technologie ein, insbesondere die KI-gesteuerte Sprachsynthese von ElevenLabs, um die In-Game-Hosts zum Leben zu erwecken.

Bevor wir ElevenLabs aufrufen, um die tatsächliche Sprache zu generieren, führen wir zunächst einen separaten KI-Durchlauf mit OpenAI durch, um strukturierten Dialog sowohl für die Frageeinführung als auch die Antwortenthüllung zu erstellen. Dieser Ansatz stellt sicher, dass jede Komponente sorgfältig kontrolliert wird, um unbeabsichtigte Abweichungen, unnötige Ausführungen oder frühzeitige Offenlegungen der richtigen Antwort zu vermeiden.

Kontrolliertes KI-Prompting zur Vermeidung von Überlauf und Halluzination

Um Genauigkeit und Struktur zu gewährleisten, geben wir spezifische Anweisungen in jedem KI-Prompt, die klar definieren:

  • Wie die KI beginnen soll – Sicherstellen, dass die Antwort in einem klaren, strukturierten Format mit einer vordefinierten Einführung beginnt, die mit dem Ton und Stil des Spiels übereinstimmt.
  • Wie die KI enden soll – Die KI explizit anweisen, wo sie aufhören soll, um „Überlauf“ zu verhindern, bei dem das Modell zusätzliche Informationen erfindet oder versucht, Spielerantworten vorherzusagen.
  • Was nicht enthalten sein sollte – Unnötige Details einschränken, wie frühe Antworthinweise, nicht verwandte Kommentare oder spekulative Dialoge.

Zum Beispiel, wenn wir Fragen-Erzählung generieren, strukturieren wir den KI-Prompt wie folgt:

  • Beginnen Sie mit einer ansprechenden Einführung, die den Ton für die Quizfrage setzt.
  • Präsentieren Sie die Multiple-Choice-Optionen klar, um sicherzustellen, dass sie neutral bleiben.
  • Enden Sie mit einem vordefinierten Satz, wie „Was denken Sie?“, um zu verhindern, dass die KI über die richtige Antwort spekuliert.

Ähnlich, wenn wir Antwortenthüllungserzählung generieren, tun wir Folgendes:

  • Beginnen Sie mit der Bestätigung der Spielerwahl und der Wiederholung der Frage, um die Kontinuität zu wahren.
  • Kündigen Sie die richtige Antwort klar an, um sicherzustellen, dass sie faktisch geliefert wird.
  • Enden Sie mit einer kurzen vordefinierten Antwort, wie „Haben Sie es richtig?“, um zusätzliche, unerwünschte KI-generierte Kommentare zu verhindern.

Minimierung von KI-Halluzinationsrisiken

Durch Aufteilung der Frage- und Antwortgenerierung in separate KI-Durchläufe und strikte Definition von Start- und Endpunkten eliminieren wir KI-Halluzinationen, die unbeabsichtigt Antworten offenbaren oder irrelevante Informationen einführen könnten. Wenn wir der KI erlauben würden, den vollständigen Dialog in einer Anfrage zu generieren, könnte sie versuchen, das Ergebnis „vorherzusehen“, was zu unerwünschter Voreingenommenheit, Inkonsistenzen oder unnötigem Füllmaterial führen könnte.

Jede Quizfrage wird von zwei KI-generierten Host-Charakteren erzählt, jeder mit unterschiedlichen Sprachstilen und Persönlichkeiten. Ihr Dialog wird dynamisch generiert und folgt einem strukturierten Format.

Beispiel für einen KI-generierten Dialog

{
  "Conversation": [
    { "VoiceId": "2", "Dialog": "Okay, Leute! Hier ist eure nächste Frage... Welches historische Ereignis führte zum weltweit ersten 'diplomatischen Streichkrieg'?" },
    { "VoiceId": "3", "Dialog": "Ooooh, ich liebe einen guten Streichkrieg! Das sollte Gummihühner und gefälschte Verträge beinhalten." },
    { "VoiceId": "2", "Dialog": "Eure Optionen sind... A) Der Französisch-Indische Krieg, B) Der Toledo-Krieg von 1835, C) Die Island-Kabeljaukriege von 1978 oder D) Der Pinguin-Vertrag von 1962." },
    { "VoiceId": "3", "Dialog": "Ehrlich gesagt, ich möchte, dass es die Pinguine sind. Diese kleinen Kerle sind gnadenlos." }
  ]
}

Sobald der strukturierte Dialog finalisiert ist, senden wir ihn an ElevenLabs für hochwertige Sprachsynthese, um eine klare, ansprechende und fehlerfreie Erzählung zu gewährleisten, die die KI-generierten Hosts des Spiels zum Leben erweckt und gleichzeitig die strikte Inhaltsgenauigkeit beibehält. Durch die Strukturierung von KI-generierten Dialogen in diesem Format eliminieren wir die Notwendigkeit für manuelles Skripten und erhalten einen natürlichen und dynamischen Gesprächsfluss.

Schritt 4: KI-gesteuertes Sound Engineering & Nachbearbeitung

Ein wesentlicher Faktor bei der Schaffung immersiver Erzählungserlebnisse ist das Sounddesign. Um KI-generierte Sprachübertragungen authentischer wirken zu lassen, wenden wir Audiobearbeitungstechniken mit NAudio an, darunter:

  • Hintergrundgeräuschüberlagerung – Hinzufügen von Publikumsreaktionen wie Applaus, Lachen oder spannungsvollen Gemurmel.
  • Dynamische Stimmeffekte – Anwenden von Hall, Echo oder Verzerrung, um verschiedene In-Game-Umgebungen zu simulieren.
  • Radio-Style-Filterung – Modifizieren von Frequenzbereichen, um Vintage-Übertragungen zu simulieren.
  • Automatisierung des Audiomixings – Kombinieren mehrerer Sprachübertragungen und Soundeffekte in Echtzeit.

Eine besondere Situation: Umgang mit Szenenübergängen und Nicht-Fragen-Dialogen

Neben der Generierung von Quizfragen und Antwortenthüllungen verwenden wir KI auch, um Szenenübergänge und Nicht-Fragen-Dialoge für wichtige Spielmomente zu erstellen, wie die Spieleinführung, Punktestandsaktualisierungen, Rundenübergänge und den abschließenden Wrap-up. Diese Segmente erfordern einen anderen Ansatz, da sie nicht um ein Frage-Antwort-Format strukturiert sind, sondern dazu dienen, die Bühne zu bereiten, Spieler zu engagieren und einen nahtlosen Fluss zwischen den Spielelementen zu gewährleisten.

Um Vielfalt und Wiederspielbarkeit sicherzustellen, generieren wir mehrere Versionen jeder Szene mit OpenAI, die bei jedem Spiel unterschiedliche Interaktionen und Tonverschiebungen ermöglichen. Zusätzlich wechseln wir programmatisch die Charaktere zufällig für jede Szene, um sicherzustellen, dass sich die Interaktionen frisch und dynamisch anfühlen. Zum Beispiel könnte in einem Durchlauf ein Punktestand-Update vom Haupt- und Co-Host geliefert werden, während in einem anderen ein sekundärer Charakter—wie ein skurriler Ansager, ein überenthusiastischer Produzent oder sogar ein Praktikant—übernimmt, was Humor und Unvorhersehbarkeit hinzufügt. Durch die Zufallszuweisung von Charakteren schaffen wir eine vielfältige Palette von Interaktionen, die verhindern, dass Dialoge repetitiv werden, und jede Spielsitzung einzigartig machen.

Um Struktur zu bewahren und Dialoginkonsistenzen zu verhindern, definieren wir klar den Anfang und das Ende jeder Szene, um sicherzustellen, dass Übergänge zwischen verschiedenen Segmenten nahtlos sind. Jedes KI-generierte Skript ist so konzipiert, dass es nahtlos mit den vorhergehenden und folgenden Dialogszenen verbunden ist, um abrupte oder unnatürliche Verschiebungen im Gespräch zu verhindern. Wir verwenden eine Kombination aus vordefinierten Intro/Outro-Markern und szenenspezifischen Einschränkungen, um sicherzustellen, dass KI-generierte Inhalte im Rahmen des beabsichtigten Erzählflusses bleiben.

Sobald die Skripte finalisiert sind, werden sie, genau wie beim Fragegenerierungsprozess, auch mit ElevenLabs-Sprachtechnologie synthetisiert und mit Umgebungsgeräuschen und Audioübergängen gemischt, um die Immersion zu erhöhen und zwischen den Szenen zu unterscheiden. Zum Beispiel wird eine Endsequenz eine Publikumsjubel-Überlagerung haben, um die Energie eines Live-Publikums zu simulieren und den Abschluss des Spiels zu verstärken. Währenddessen wird eine Vorshow-Backstage-Szene einen Telefonfilter-Pass auf das Audio angewendet haben, um den Vor-Intro-Dialog hörbar vom eigentlichen Spielshow selbst zu unterscheiden. Diese Soundeffekte und Bearbeitungstechniken helfen, ein ansprechenderes und filmischeres Erlebnis zu schaffen, das jede Szene einzigartig macht und die Gesamtproduktionsqualität verstärkt.

Unser Plan zur Erweiterung der KI-Sounddesign-Fähigkeiten in der Zukunft

In Zukunft planen wir, unsere KI-gesteuerten Sounddesign-Tools zu erweitern, indem wir eine größere Soundeffektbibliothek und zusätzliche Audiofilter entwickeln, die KI dynamisch in Echtzeit anwenden kann. Dies würde es dem System ermöglichen, Audioeffekte basierend auf der Szene anzupassen, sei es das Hinzufügen von Echo in einem leeren Raum oder das Überlagern von Sturmgeräuschen für dramatische Effekte.

Wir planen auch, einen KI-generierten alten Radio-Erzählkanal zu starten, der diese Tools nutzt, um automatisierte Horror- und Sci-Fi-Audiodramen zu erstellen. Diese werden sowohl als technische Demonstration unserer KI-Erzählfähigkeiten als auch als neue Unterhaltungsform dienen, die zeigt, wie KI dynamisch Geschichten, Dialoge und vollständig gemischte Klanglandschaften ohne menschliches Eingreifen generieren kann.

Eine letzte Überlegung: KI-Nutzung und Kosteneffizienz

KI ist ein mächtiges Werkzeug für dynamische Erzählungen und Inhaltserstellung, aber es bringt reale Kosten mit sich—sowohl in Bezug auf Rechenressourcen als auch auf finanzielle Aufwendungen. Jede KI-generierte Sprachzeile, Echtzeit-Interaktion oder dynamisch konstruierte Szene erfordert Rechenleistung und API-Aufrufe, die sich je nach Nutzung skalieren. Da die KI-Akzeptanz im Gaming wächst, wird das Verständnis und Management dieser Kosten zu einem kritischen Teil der Entwicklung.

Um KI-gesteuerte Immersion mit Kosteneffizienz in Einklang zu bringen, entwerfen wir zwei Versionen dieses Spiels, die jeweils für unterschiedliche Anwendungsfälle optimiert sind.

Die erste Version wird Übergangsszenen-Dialoge in Echtzeit dynamisch generieren, sodass KI direkt mit Spielern und Teams namentlich interagieren kann. Diese Version ist für Live-Übertragungen auf Plattformen wie YouTube und Twitch gedacht, wo wir die Spielsitzung als einzigartiges, singuläres Erlebnis steuern. Da sie nur einmal pro Sitzung läuft, bleiben die Kosten für die KI-Verarbeitung überschaubar. Diese Version erhöht das Engagement, indem KI-generierte Hosts in Echtzeit mit dem Publikum interagieren und ein vollständig dynamisches Erlebnis bieten, das die Kosten rechtfertigt.

Allerdings ist die Generierung von KI-gesteuertem Dialog nicht sofort. Im Durchschnitt dauert es zwischen 4 und 7 Sekunden, um eine Dialogzeile zu generieren und in Sprache umzuwandeln, zu Kosten von $0,16 bis $0,20 pro Aufruf. Dies erforderte, dass wir sorgfältig planen, wann und wie KI-generierte Inhalte erstellt werden, um Unterbrechungen des Spielerlebnisses zu vermeiden. Um spürbare Verzögerungen zu minimieren, haben wir unser System so konzipiert, dass es Inhalte vorlädt, bevor sie benötigt werden, oder sie während natürlicher Pausen generiert, wie wenn Spielern Zeit gegeben wird, eine Frage zu beantworten. Dies gewährleistet ein nahtloses Erlebnis und verhindert Unterbrechungen, die Spieler aus dem Spiel reißen könnten.

Um Kostenbedenken zu adressieren, ist die zweite Version, die innerhalb von Gig.Game vorgestellt wird, für privates Gameplay konzipiert und muss eine hohe Anzahl von Sitzungen ohne übermäßige Kosten unterstützen. Anstatt für jede Sitzung Echtzeit-KI-Dialoge zu generieren, generieren wir im Voraus eine Reihe von KI-erstellten Übergängen und Dialogsegmenten, um ein hochwertiges, konsistentes Erlebnis zu gewährleisten und gleichzeitig die on-the-fly KI-Verarbeitung zu minimieren. Dies ermöglicht es uns, skalierbares, kosteneffizientes Gameplay anzubieten, ohne die Immersion zu opfern.

Der Schlüssel hier ist, dass die KI-Nutzung strategisch geplant werden muss. Während Echtzeit-KI-gesteuerte Erlebnisse unvergleichliches Engagement bieten, sind sie am besten für kontrollierte, einmalige Umgebungen wie Live-Übertragungen geeignet. Im Gegensatz dazu ermöglicht vorgenerierter KI-Inhalt skalierbares, wiederholbares Gameplay, ohne laufende KI-Verarbeitungskosten zu verursachen. Durch die Nutzung beider Ansätze stellen wir sicher, dass KI ein Enabler für Innovation bleibt, anstatt ein Kostenengpass, während die Fluidität und das Engagement erhalten bleiben, die für ein immersives Spielerlebnis notwendig sind.

AI4 2025: Präsentation von KI-Erzählungen in Aktion

Während wir unsere KI-gesteuerte Erzählmaschine weiter verfeinern, erkunden wir neue Anwendungen für KI-generierte narrative Erlebnisse über Quizspiele hinaus, einschließlich:

  • Automatisierte interaktive Fiktion – KI-generierte verzweigte Erzählungen, die sich basierend auf Spielerentscheidungen ändern.
  • KI-gesteuerte Spiel-Sprachübertragungen – Dynamische NPCs, die in Echtzeit auf das Spielerverhalten reagieren.
  • KI-gesteuerte Live-Spielereignisse – In-Game-Geschichten, die sich automatisch mit KI-generierten Dialogen und Audio entwickeln.

Ich werde bei AI4 2025 in Las Vegas sein, wo ich gespannt bin, wie andere im Bereich der KI-gestützten Spieleentwicklung innovieren. Ich werde auch In-Suite-Demos unserer KI-Erzähltechnologie geben, die zeigen, wie KI Erzählgenerierung, Sprachschauspielerei und Sound Engineering automatisieren kann, um die Arbeitsabläufe der Spieleentwicklung zu verbessern.

Wenn Sie an der Zukunft der KI im Gaming interessiert sind, lassen Sie uns in Kontakt treten. Wo sehen Sie den größten Einfluss von KI auf das Erzählen von Geschichten? Lassen Sie uns diskutieren.

Vorheriger Artikel

Die Zukunft der Spielshows ist da – und Sie sind eingeladen!