GenAI Llama - Lokale KI-Modelle in der Unreal Engine

Lokale KI-Modelle in Unreal Engine Spielen und Anwendungen ausfuhren — keine Cloud-APIs, kein Internet erforderlich, keine Kosten pro Token. GenAI Llama (ehemals Unreal Ollama) unterstutzt zwei Modi: Verbindung zu einem beliebigen lokalen Inferenz-Server (Ollama, LM Studio, llama.cpp Server, vLLM, LocalAI, Jan) uber HTTP, oder GGUF-Modelle direkt im Spielprozess mit eingebetteter llama.cpp-Inferenz ausfuhren. Llama 3, Mistral, Phi, Gemma, DeepSeek und hunderte weitere Modelle lokal ausfuhren.

Zwei Betriebsmodi

HTTP-Anbieter — Verbindung zu einem beliebigen lokalen Inferenz-Server. Funktioniert sofort mit Ollama, LM Studio, llama.cpp Server, vLLM, LocalAI, Jan oder jedem OpenAI-kompatiblen Endpunkt.

Eingebettete Inferenz (llama.cpp) — GGUF-Modelle direkt im Spielprozess ausfuhren. Kein Server erforderlich. Funktioniert vollstandig offline auf PC und Mobilgeraten. Optional — erfordert die Kompilierung der llama.cpp-Bibliotheken fur Ihre Zielplattform.

Hauptfunktionen:

  • 7 Unterstutzte Anbieter:
    Ollama, LM Studio, llama.cpp Server, vLLM, LocalAI, Jan (HTTP), plus eingebettetes llama.cpp fur serverlose In-Prozess-Inferenz.

  • Eingebettete Inferenz:
    GGUF-Modelle direkt im Spielprozess ausfuhren — kein Server, kein Netzwerk, kein Internet. Modelle zur Laufzeit laden und entladen. GPU-Beschleunigung uber CUDA, Vulkan oder Metal.

  • 100% Lokal & Offline:
    Alle KI-Verarbeitung lauft auf dem Rechner des Spielers. Keine Daten verlassen das Gerat. Perfekt fur datenschutzsensible Anwendungen und Offline-Gameplay.

  • Keine Kosten pro Anfrage:
    Sobald ein Modell heruntergeladen ist, konnen Sie unbegrenzt KI-Interaktionen ausfuhren. Keine API-Rechnungen, keine Abonnements.

  • Chat-Vervollstandigungen & Streaming:
    Vollstandige Chat-Vervollstandigung und Echtzeit-Token-fur-Token-Streaming. Erstellen Sie Schreibmaschineneffekte, Live-Dialoge und reaktionsfahige KI-Begleiter.

  • Multimodale Vision:
    Senden Sie Bilder zusammen mit Text mit Modellen wie llava oder llama3.2-vision. UTexture2D-Assets direkt ubergeben — das Plugin ubernimmt die Base64-Konvertierung automatisch.

  • Generierungsoptionen:
    Temperature, Top P, Max Tokens, Seed, Stop-Sequenzen, JSON-Format-Ausgabe und System-Prompt-Unterstutzung.

  • Server-Verwaltung:
    Health-Check, verfugbare Modelle auflisten und Anbieter-Wechsel zur Laufzeit.

  • Blueprint & C++ bereit:
    Volle Blueprint-Unterstutzung mit asynchronen Latent-Nodes, plus eine vollstandige C++ API mit Delegates. Basiert auf UCancellableAsyncAction fur ordnungsgemaees Lifetime-Management.

  • Breite Plattform-Unterstutzung:
    HTTP-Anbieter: Windows, macOS, Linux, Android, iOS, PS4, Xbox One, Switch, HoloLens. Eingebettete Inferenz: Windows, macOS, Linux, Android, iOS. Engine-Unterstutzung: UE 5.1 bis 5.7.

Kompatible Modelle

Verwenden Sie jedes Modell aus der Ollama-Bibliothek (HTTP) oder jedes GGUF-Modell von Hugging Face (eingebettet):

  • Allgemeiner Chat: llama3, mistral, gemma, phi-3, nemotron-3-nano
  • Multimodal (Vision): llava, llama3.2-vision, moondream
  • Programmierung: codellama, starcoder2, deepseek-coder
  • Klein & Schnell: gemma3:1b, phi-3:mini, tinyllama, qwen2.5-0.5b

Anwendungsfalle:

  • Offline-NPC-Dialoge: Charakter-Dialoge generieren, die ohne Internetverbindung funktionieren — unverzichtbar fur Einzelspieler-Spiele, Konsolen-Titel und Demos.
  • Datenschutz-First-Anwendungen: Alle Spieler-KI-Gesprache auf dem Gerat behalten. Keine Daten verlassen jemals die Maschine.
  • Spiele mit KI ausliefern: Ein GGUF-Modell mit Ihrem Spiel uber eingebettete Inferenz bundeln. Spieler mussen nichts Zusatzliches installieren.
  • Konsole & Mobile KI: HTTP-Anbieter funktionieren auf PS4, Xbox, Switch und HoloLens. Eingebettete Inferenz funktioniert auf Android und iOS.
  • Schnelles Prototyping: KI-Funktionen sofort testen mit der GUI von LM Studio oder der CLI von Ollama.
  • Hybride Architektur: Lokale Modelle fur routinemaige Interaktionen und Cloud-Modelle (uber unser GenAI for Unreal Plugin) fur Momente, die Spitzen-Intelligenz erfordern.

Warum dieses Plugin wahlen?

  • Flexibelste lokale KI: 7 Anbieter + eingebettete Inferenz. Kein anderes Plugin deckt diesen Bereich ab.
  • Produktionsreif: Basiert auf UCancellableAsyncAction mit ordnungsgemaeem Lifetime-Management, Abbruch-Unterstutzung und thread-sicherer eingebetteter Inferenz.
  • Konsolen-Unterstutzung: HTTP-Anbieter funktionieren auf PS4, Xbox One, Switch und HoloLens — Plattformen, die kein anderes lokales KI-Plugin unterstutzt.
  • Von Entwicklern, fur Entwickler: Erstellt vom selben Team hinter GenAI for Unreal und GenAI Chinese Models.
  • Dedizierter Support: Treten Sie unserem Discord bei oder schreiben Sie uns eine E-Mail.

Ressourcen & Support