Lokale KI-Modelle in Unreal Engine Spielen und Anwendungen ausfuhren — keine Cloud-APIs, kein Internet erforderlich, keine Kosten pro Token. GenAI Llama (ehemals Unreal Ollama) unterstutzt zwei Modi: Verbindung zu einem beliebigen lokalen Inferenz-Server (Ollama, LM Studio, llama.cpp Server, vLLM, LocalAI, Jan) uber HTTP, oder GGUF-Modelle direkt im Spielprozess mit eingebetteter llama.cpp-Inferenz ausfuhren. Llama 3, Mistral, Phi, Gemma, DeepSeek und hunderte weitere Modelle lokal ausfuhren.
Zwei Betriebsmodi
HTTP-Anbieter — Verbindung zu einem beliebigen lokalen Inferenz-Server. Funktioniert sofort mit Ollama, LM Studio, llama.cpp Server, vLLM, LocalAI, Jan oder jedem OpenAI-kompatiblen Endpunkt.
Eingebettete Inferenz (llama.cpp) — GGUF-Modelle direkt im Spielprozess ausfuhren. Kein Server erforderlich. Funktioniert vollstandig offline auf PC und Mobilgeraten. Optional — erfordert die Kompilierung der llama.cpp-Bibliotheken fur Ihre Zielplattform.
Hauptfunktionen:
-
7 Unterstutzte Anbieter:
Ollama, LM Studio, llama.cpp Server, vLLM, LocalAI, Jan (HTTP), plus eingebettetes llama.cpp fur serverlose In-Prozess-Inferenz. -
Eingebettete Inferenz:
GGUF-Modelle direkt im Spielprozess ausfuhren — kein Server, kein Netzwerk, kein Internet. Modelle zur Laufzeit laden und entladen. GPU-Beschleunigung uber CUDA, Vulkan oder Metal. -
100% Lokal & Offline:
Alle KI-Verarbeitung lauft auf dem Rechner des Spielers. Keine Daten verlassen das Gerat. Perfekt fur datenschutzsensible Anwendungen und Offline-Gameplay. -
Keine Kosten pro Anfrage:
Sobald ein Modell heruntergeladen ist, konnen Sie unbegrenzt KI-Interaktionen ausfuhren. Keine API-Rechnungen, keine Abonnements. -
Chat-Vervollstandigungen & Streaming:
Vollstandige Chat-Vervollstandigung und Echtzeit-Token-fur-Token-Streaming. Erstellen Sie Schreibmaschineneffekte, Live-Dialoge und reaktionsfahige KI-Begleiter. -
Multimodale Vision:
Senden Sie Bilder zusammen mit Text mit Modellen wiellavaoderllama3.2-vision. UTexture2D-Assets direkt ubergeben — das Plugin ubernimmt die Base64-Konvertierung automatisch. -
Generierungsoptionen:
Temperature, Top P, Max Tokens, Seed, Stop-Sequenzen, JSON-Format-Ausgabe und System-Prompt-Unterstutzung. -
Server-Verwaltung:
Health-Check, verfugbare Modelle auflisten und Anbieter-Wechsel zur Laufzeit. -
Blueprint & C++ bereit:
Volle Blueprint-Unterstutzung mit asynchronen Latent-Nodes, plus eine vollstandige C++ API mit Delegates. Basiert aufUCancellableAsyncActionfur ordnungsgemaees Lifetime-Management. -
Breite Plattform-Unterstutzung:
HTTP-Anbieter: Windows, macOS, Linux, Android, iOS, PS4, Xbox One, Switch, HoloLens. Eingebettete Inferenz: Windows, macOS, Linux, Android, iOS. Engine-Unterstutzung: UE 5.1 bis 5.7.
Kompatible Modelle
Verwenden Sie jedes Modell aus der Ollama-Bibliothek (HTTP) oder jedes GGUF-Modell von Hugging Face (eingebettet):
- Allgemeiner Chat:
llama3,mistral,gemma,phi-3,nemotron-3-nano - Multimodal (Vision):
llava,llama3.2-vision,moondream - Programmierung:
codellama,starcoder2,deepseek-coder - Klein & Schnell:
gemma3:1b,phi-3:mini,tinyllama,qwen2.5-0.5b
Anwendungsfalle:
- Offline-NPC-Dialoge: Charakter-Dialoge generieren, die ohne Internetverbindung funktionieren — unverzichtbar fur Einzelspieler-Spiele, Konsolen-Titel und Demos.
- Datenschutz-First-Anwendungen: Alle Spieler-KI-Gesprache auf dem Gerat behalten. Keine Daten verlassen jemals die Maschine.
- Spiele mit KI ausliefern: Ein GGUF-Modell mit Ihrem Spiel uber eingebettete Inferenz bundeln. Spieler mussen nichts Zusatzliches installieren.
- Konsole & Mobile KI: HTTP-Anbieter funktionieren auf PS4, Xbox, Switch und HoloLens. Eingebettete Inferenz funktioniert auf Android und iOS.
- Schnelles Prototyping: KI-Funktionen sofort testen mit der GUI von LM Studio oder der CLI von Ollama.
- Hybride Architektur: Lokale Modelle fur routinemaige Interaktionen und Cloud-Modelle (uber unser GenAI for Unreal Plugin) fur Momente, die Spitzen-Intelligenz erfordern.
Warum dieses Plugin wahlen?
- Flexibelste lokale KI: 7 Anbieter + eingebettete Inferenz. Kein anderes Plugin deckt diesen Bereich ab.
- Produktionsreif: Basiert auf
UCancellableAsyncActionmit ordnungsgemaeem Lifetime-Management, Abbruch-Unterstutzung und thread-sicherer eingebetteter Inferenz. - Konsolen-Unterstutzung: HTTP-Anbieter funktionieren auf PS4, Xbox One, Switch und HoloLens — Plattformen, die kein anderes lokales KI-Plugin unterstutzt.
- Von Entwicklern, fur Entwickler: Erstellt vom selben Team hinter GenAI for Unreal und GenAI Chinese Models.
- Dedizierter Support: Treten Sie unserem Discord bei oder schreiben Sie uns eine E-Mail.
Ressourcen & Support
- Dokumentation
- Discord Community
- Professioneller Support: [email protected]