GenAI Llama - Unreal Engine でローカル AI モデルを実行

クラウド API 不要、インターネット接続不要、リクエストごとの課金なし — Unreal Engine のゲームやアプリ内でローカル AI モデルを実行。 GenAI Llama(旧 Unreal Ollama)は 2 つのモードをサポートします。HTTP 経由でローカル推論サーバー(Ollama、LM Studio、llama.cpp サーバー、vLLM、LocalAI、Jan)に接続するモードと、組み込み llama.cpp 推論によって GGUF モデルをゲームプロセス内で直接実行するモードです。Llama 3、Mistral、Phi、Gemma、DeepSeek など数百種類のモデルをローカルで実行できます。

2 つの動作モード

HTTP プロバイダー — 任意のローカル推論サーバーに接続。Ollama、LM Studio、llama.cpp サーバー、vLLM、LocalAI、Jan、または OpenAI 互換エンドポイントと即座に動作します。

組み込み推論(llama.cpp) — GGUF モデルをゲームプロセス内で直接実行。サーバー不要。PC およびモバイルで完全オフライン動作。オプション機能 — ターゲットプラットフォーム向けに llama.cpp ライブラリのコンパイルが必要です。

主な機能:

  • 7 つの対応プロバイダー:
    Ollama、LM Studio、llama.cpp サーバー、vLLM、LocalAI、Jan(HTTP)、およびサーバーレスのインプロセス推論向け組み込み llama.cpp。

  • 組み込み推論:
    GGUF モデルをゲームプロセス内で直接実行 — サーバー不要、ネットワーク不要、インターネット不要。ランタイムにモデルのロード・アンロードが可能。CUDA、Vulkan、Metal による GPU アクセラレーション対応。

  • 100% ローカル&オフライン:
    すべての AI 処理はプレイヤーのマシン上で実行されます。データはデバイスから外部に送信されません。プライバシーが重要なアプリケーションやオフラインゲームに最適です。

  • リクエストごとのコストゼロ:
    モデルをダウンロードすれば、API の請求なしで無制限に AI インタラクションを実行できます。サブスクリプションも不要です。

  • チャット補完&ストリーミング:
    完全なチャット補完とリアルタイムのトークンごとストリーミング。タイプライター効果、ライブダイアログ、レスポンシブな AI コンパニオンを作成できます。

  • マルチモーダルビジョン:
    llavallama3.2-vision などのモデルを使用してテキストとともに画像を送信。UTexture2D アセットを直接渡すだけ — プラグインが Base64 変換を自動的に処理します。

  • 生成オプション:
    Temperature、Top P、Max Tokens、Seed、Stop シーケンス、JSON フォーマット出力、システムプロンプトをサポート。

  • サーバー管理:
    ヘルスチェック、利用可能なモデルの一覧表示、ランタイムでのプロバイダー切り替え。

  • Blueprint & C++ 対応:
    非同期レイテントノードによる完全な Blueprint サポートと、デリゲートを備えた完全な C++ API。適切なライフタイム管理のために UCancellableAsyncAction で構築。

  • 幅広いプラットフォームサポート:
    HTTP プロバイダー:Windows、macOS、Linux、Android、iOS、PS4、Xbox One、Switch、HoloLens。組み込み推論:Windows、macOS、Linux、Android、iOS。エンジンサポート:UE 5.1 〜 5.7。

対応モデル

Ollama ライブラリの任意のモデル(HTTP)または Hugging Face の任意の GGUF モデル(組み込み)を使用できます:

  • 一般チャット: llama3mistralgemmaphi-3nemotron-3-nano
  • マルチモーダル(ビジョン): llavallama3.2-visionmoondream
  • コーディング: codellamastarcoder2deepseek-coder
  • 小型&高速: gemma3:1bphi-3:minitinyllamaqwen2.5-0.5b

ユースケース:

  • オフライン NPC ダイアログ:インターネット接続なしで動作するキャラクターダイアログを生成 — シングルプレイヤーゲーム、コンソールタイトル、デモに不可欠。
  • プライバシー重視のアプリケーション:プレイヤーと AI のすべての会話をデバイス上に保持。データがマシンから外部に送信されることはありません。
  • AI 搭載の出荷ゲーム:組み込み推論によって GGUF モデルをゲームにバンドル。プレイヤーが追加でインストールするものは何もありません。
  • コンソール&モバイル AI:HTTP プロバイダーは PS4、Xbox、Switch、HoloLens で動作。組み込み推論は Android および iOS で動作します。
  • ラピッドプロトタイピング:LM Studio の GUI や Ollama の CLI を使って AI 機能を即座にテスト。
  • ハイブリッドアーキテクチャ:ルーチンインタラクションにはローカルモデルを、ピークインテリジェンスが求められる場面にはクラウドモデル(GenAI for Unreal プラグイン経由)を使用。

このプラグインを選ぶ理由

  • 最も柔軟なローカル AI: 7 つのプロバイダー+組み込み推論。これほどの範囲をカバーするプラグインは他にありません。
  • プロダクションレディ:適切なライフタイム管理、キャンセルサポート、スレッドセーフな組み込み推論を備えた UCancellableAsyncAction で構築。
  • コンソールサポート: HTTP プロバイダーは PS4、Xbox One、Switch、HoloLens で動作 — 他のどのローカル AI プラグインもサポートしていないプラットフォームです。
  • 開発者による、開発者のための: GenAI for UnrealGenAI Chinese Models を開発した同じチームが制作。
  • 専用サポート: Discord に参加するかメールでお問い合わせください。

リソース&サポート