// tier: helix-primary · order 4

HelixLLM betalicense: TBD

GoGinHTTP/3 QUICTLS 1.3llama.cppLLMsVerifiergRPCSSEKafkaPrometheusOpenTelemetry

Source

HelixLLM — scored provider fallback chain Ranked by LLMsVerifier (5-min refresh) ↓ skip on 429 / 5xx Request OpenAI / Anthropic API HTTP/3 Gateway TLS 1.3 · QUIC Chutes OpenRouter Cerebras SambaNova Together llama.cpp (local) guaranteed fallback Response first success wins
// architecture

1つのバイナリ、6つのモード——OpenAIとAnthropicに対応した、ラップトップからマルチホストクラスターまでの推論システム

HelixLLMは、エンタープライズグレードの分散型LLMシステムであり、Goで構築された単一バイナリによるモードシステムを採用。単一ホストでの開発からマルチホストでの本番運用までスケール可能です。HTTP/3上で完全なOpenAIおよびAnthropic互換APIを提供し、ローカルのllama.cpp推論、スコアリングされたマルチプロバイダーフォールバックチェーン、RAGパイプライン、そしてReActエージェントシステムを搭載しています。

HelixLLMは、単一バイナリかつGoベースの分散型LLMシステムです。HTTP/3上でOpenAIおよびAnthropic互換APIを公開し、ローカルのllama.cpp推論を実行。無料クラウドプロバイダーを自動検出・スコアリングしてフェイルオーバーチェーンを構築し、RAGナレッジパイプラインとツールコール機能を持つReActエージェントを追加——6つのモードで展開可能です。

HelixLLMは、GoとGinで構築されたエンタープライズグレードの分散型LLMシステムであり、その最大の特徴は、1つの成果物があらゆる規模に対応する点にあります。単一バイナリにコンパイルされ、デプロイ時にモードシステムがそのバイナリの役割を決定します。ラップトップ上でfullモードとして実行すればオールインワンのインスタンスとして機能し、gatewaybrainknowledgeagentscontrolの各モードを複数ホストに分散させることも可能です。同じコードが、開発者のマシンから本番環境のクラスターまで、書き換えではなく再配置によって対応します。

HelixLLMは2つの方言を流暢に話します。完全なOpenAIおよびAnthropic互換APIを提供するため、どちらのエコシステムからのSDKクライアントも変更なしで動作します。これらはすべてHTTP/3(QUIC)上で提供され、自動的なHTTP/2フォールバックとTLS 1.3に対応。ローカル推論はllama.cppを使用し、CUDA、Metal、ROCmをサポートするため、Nvidia、Apple、AMDのハードウェア上で同じビルドが高速化されます。特に注目すべきはマルチプロバイダーフォールバックチェーンで、無料クラウド推論の信頼性の低さを管理された自己修復型リソースに変換します。HelixLLMは7つ以上のクラウドプロバイダー(Chutes、OpenRouter、HuggingFace、Nvidia、Cerebras、SambaNova、Together)から無料モデルを自動検出し、5分ごとにLLMsVerifierでスコアリング。ランク付けされたチェーンを通じてルーティングし、429/5xxエラー時には自動的にフェイルオーバーを実行します。常にローカルのllama.cppが最終的な保証として機能するため、利用可能なプロバイダーがないという理由でリクエストが失敗することはありません。

HelixLLMは単なる推論システムにとどまらず、完全なアプリケーションプラットフォームです。RAGナレッジパイプライン(取り込み、チャンク化、埋め込み、vector検索)と、ツールコール機能、会話セッション、RAG統合を備えたReActエージェントシステムが同じバイナリに搭載されています。モードシステムはネットワークレベルでも効果を発揮します。fullモードではすべてのレイヤーがプロセス内の直接的なGoコールで通信し、ネットワークオーバーヘッドはゼロです。一方、同じバイナリをホスト間に分散させた場合でも、gRPC、SSE、Kafkaを介して連携します。さらに、Brotli/gzipによるコンテンツネゴシエーション、OpenAIおよびAnthropicのフォーマットにバイト単位で一致するSSEストリーミング、APIキーとJWT認証によるレートリミット、Prometheusメトリクス、OpenTelemetryトレーシング、そして本番インフラ用の豊富なGoサブモジュール群が揃っています。

コンテンツ

チームには、ポータブルで標準準拠、かつレジリエントな推論が必要です。クライアントを書き換えたり、特定のプロバイダーやマシンに依存したりすることなく。HelixLLMは、同じバイナリがローカルでの開発にも対応し、複数ホストの本番クラスターへとスケールできるように設計されました。その際、クライアントが既に使用しているOpenAIやAnthropicのダイアレクトをそのまま利用できます。

HelixLLMは、ゲートウェイ、ローカル推論、クラウドフォールバック、RAG、エージェントといった推論スタック全体を、モード切り替えで制御できる単一のバイナリに集約します。これにより、デプロイするアーキテクチャは、再プラットフォーミングプロジェクトではなく、実行時の判断で決定できるようになります。さらに、これまでの弱点を強みに変えました。クラウドプロバイダーの信頼性は、第一級の継続的に測定される課題となり、数分ごとにプロバイダーを再評価し、自己修復型のフォールバックチェーンによって処理されます。そして、いずれかのアップストリームプロバイダーがレート制限や障害を起こしても、ローカル推論への確実なフォールバックが保証されるため、標準準拠でラップトップからクラスターまでポータブルな、真に依存できる単一のエンドポイントが実現します。

  • 6つのモードを持つ単一バイナリ:すべてを統合して動作するか、分散ロールとして機能します。fullモードではプロセス内の直接Go呼び出し、分散モードではgRPC/SSE/Kafkaを使用。デプロイメントトポロジーの変更が、コードの変更や意図しないネットワークコストなしで可能です。
  • スコアリングと自動検出によるマルチプロバイダーフォールバックチェーン:7つ以上の無料プロバイダーを横断し、LLMsVerifierによる継続的なランキングを実施。429/5xxエラー時の自動フェイルオーバーと、最終手段としてのllama.cppを保証。無料ティアの容量が信頼性の高いリソースに変わります。
  • OpenAIとAnthropicの両方に対応したインターフェース:HTTP/3上で提供され、HTTP/2への自動フォールバックも実装。どちらのエコシステムのクライアントも、変更なしで接続可能です。
  • 単一コードベースでCUDA、Metal、ROCmに対応:同じビルドがNVIDIA、Apple、AMDのハードウェア上で加速実行されます。

  • ホスト単位から多数へのスケーリングを書き換えなしで実現

多くのシステムでは「ローカル開発」と「分散本番」の間に明確な境界があり、それを越えるにはアーキテクチャの再設計が必要です。私たちは単一バイナリ上のモードシステムでこの境界を取り払いました。fullモードでは同じレイヤーがプロセス内の直接呼び出しで通信し、分散モードではgRPC/SSE/Kafkaに透過的に切り替わります。これにより、スケールアウトは設定変更だけで可能になりました。

  • 信頼性が低くレート制限のある無料クラウドプロバイダー

無料ティアの推論は高速ですが、429エラーやリクエスト中の消失が発生します。私たちは、利用可能なモデルを自動検出し、LLMsVerifierでスコアリング、レート制限ヘッダーを事前に追跡してスロットリング寸前のプロバイダーを回避、さらにランキングされたチェーンに沿って自動的にフォールバックし、最終的にはローカルのllama.cppに切り替える仕組みを構築しました。これにより、プールの不安定さが呼び出し元に影響を与えることはありません。

  • 2つのエコシステムにまたがるクライアント互換性

新しい推論バックエンドにクライアントを書き換えるのは現実的ではありません。私たちはOpenAIとAnthropicの両方のAPI形状を実装しました。異なるSSEストリーミング形式に至るまで対応しているため、どちらの陣営のSDKもHelixLLMを指定するだけでそのまま動作します。

コンテンツ

  • Go + Gin — システム全体を可能にするのは、単一バイナリかつ並行処理を第一に考えたランタイムであるため選択。ノートPCサーバーとしてもクラスターロールとしても動作する単一のビルドを実現し、システム全体とゲートウェイのHTTPレイヤーを内包する。
  • HTTP/3(QUIC)+ TLS 1.3(HTTP/2フォールバック付き) — 最新かつ低遅延で接続耐性に優れたトランスポートとして選択。サーバーインターフェースとして公開され、QUICに対応できないクライアントは自動的にHTTP/2にフォールバックする。
  • llama.cpp(CUDA/Metal/ROCm) — NVIDIA、Apple、AMDの各バックエンドで加速可能なポータブルなローカル推論エンジンとして選択。単一のコードベースで動作し、フォールバックチェーンの最終保証プロバイダーとしても機能し、システムが完全に停止することを防ぐ。
  • LLMsVerifier — 「現在どのプロバイダーが優れているか」を数値化するために選択。5分ごとにクラウドフォールバックチェーンをスコアリング・ランキングし、ルーティングがリアルタイムの品質に基づいて行われるようにする。
  • クラウドプロバイダー(Chutes、OpenRouter、HuggingFace、Nvidia、Cerebras、SambaNova、Together) — 複数のアップストリームから無料枠のリソースを活用するために選択。自動的に検出され、単一のフェイルオーバーチェーンにランキングされるため、特定のプロバイダーが単一障害点になることはない。
  • gRPC + SSE + Kafka — 分散デプロイメントにおけるモード間通信のトランスポートとして選択。gRPCはサービス間通信、SSEはストリーミング、Kafkaはロール間の非同期イベントフローに使用される。
  • ベクトルストア / embeddings — RAGのナレッジパイプラインをエンドツーエンドで支えるために選択。ドキュメントの取り込み、チャンク化、埋め込み、検索を通じてモデルの回答を根拠づける。
  • Prometheus + OpenTelemetry — デプロイされたモードを問わず、リクエストを追跡するメトリクスと分散トレーシングのために選択。
  • vasic-digital Goサブモジュール — 既存の堅牢なプロダクションインフラのプリミティブを再利用するために選択。これにより、システムの基盤がより広範なスタックと一貫性を保つ。

  • ステータス:ベータ版。機能は動作するが、分散推論システムとして開発中。
  • ライセンス:未定。リポジトリのメタデータにはライセンス情報が記載されていない(licenseInfoがnull)。これは未検証であり、ライセンスを明示する前に解決が必要。
  • 公式リポジトリは現在github.com/HelixDevelopment/llmに解決される。HelixLLMのパスはリダイレクトされる。READMEに記載されているカバレッジ閾値やサブモジュール数は自己申告によるもの。

優先度:Helix-プライマリ。