// स्तर: helix-primary · क्रम 4
HelixLLM बीटालाइसेंस: TBD
स्रोत
एक बाइनरी, छह मोड — आपके लैपटॉप से लेकर बहु-होस्ट क्लस्टर तक OpenAI- और Anthropic-संगत अनुमान।
HelixLLM एक एकल-बाइनरी, Go-आधारित वितरित LLM प्रणाली है। यह OpenAI- और Anthropic-संगत API को HTTP/3 पर उपलब्ध कराता है, स्थानीय llama.cpp अनुमान चलाता है, मुफ़्त क्लाउड प्रदाताओं को स्वतः खोजकर उन्हें फ़ेलओवर चेन में स्कोर करता है, और इसमें RAG ज्ञान पाइपलाइन के साथ-साथ टूल-कॉलिंग ReAct एजेंट भी शामिल है — जिसे छह मोड में तैनात किया जा सकता है।
HelixLLM एक एंटरप्राइज़-ग्रेड वितरित LLM प्रणाली है, जो Go पर आधारित है: एकल बाइनरी जिसमें मोड प्रणाली है जो एकल-होस्ट विकास से लेकर बहु-होस्ट उत्पादन तक स्केल होती है। यह पूरी तरह से OpenAI- और Anthropic-संगत API को HTTP/3 पर उपलब्ध कराता है, जिसमें स्थानीय llama.cpp अनुमान, स्कोर-आधारित बहु-प्रदाता फ़ॉलबैक चेन, RAG पाइपलाइन और ReAct एजेंट प्रणाली शामिल है।
HelixLLM एक एंटरप्राइज़-ग्रेड वितरित LLM प्रणाली है, जो Go में Gin के साथ निर्मित है, और इसकी मुख्य विशेषता यह है कि एक ही आर्टिफैक्ट हर पैमाने पर काम करता है। यह एकल बाइनरी में संकलित होता है, जिसका मोड सिस्टम तैनाती के समय तय करता है कि वह बाइनरी *क्या* है: इसे full मोड में लैपटॉप पर ऑल-इन-वन इंस्टेंस के रूप में चलाएँ, या फिर gateway, brain, knowledge, agents, और control मोड में जिम्मेदारियों को कई होस्ट पर बाँट दें — वही कोड, फिर से लिखा नहीं बल्कि पुनर्व्यवस्थित किया गया, डेवलपर की मशीन से लेकर उत्पादन क्लस्टर तक।
यह दो भाषाओं में धाराप्रवाह संवाद करता है: पूरी तरह से OpenAI- और Anthropic-संगत API, ताकि दोनों पारिस्थितिकी तंत्रों के मौजूदा SDK क्लाइंट बिना किसी बदलाव के काम करें, सभी HTTP/3 (QUIC) पर उपलब्ध कराए जाते हैं, जिसमें स्वचालित HTTP/2 फ़ॉलबैक और TLS 1.3 शामिल है। स्थानीय अनुमान llama.cpp के माध्यम से चलता है, जिसमें CUDA, Metal और ROCm समर्थन है, ताकि एक ही बिल्ड Nvidia, Apple और AMD हार्डवेयर पर समान रूप से तेज़ हो। इसकी सबसे खास विशेषता बहु-प्रदाता फ़ॉलबैक चेन है, जो मुफ़्त क्लाउड अनुमान की कुख्यात अविश्वसनीयता को एक प्रबंधित, स्व-उपचार संसाधन में बदल देती है: HelixLLM स्वतः 7+ क्लाउड प्रदाताओं (Chutes, OpenRouter, HuggingFace, Nvidia, Cerebras, SambaNova, Together) से मुफ़्त मॉडल खोजता है, उन्हें LLMsVerifier के माध्यम से हर 5 मिनट में स्कोर करता है, और रैंक की गई चेन के माध्यम से रूट करता है, जिसमें स्वचालित 429/5xx फ़ेलओवर होता है — हमेशा स्थानीय llama.cpp को अंतिम गारंटीकृत विकल्प के रूप में रखते हुए, ताकि किसी अनुरोध के लिए कभी भी केवल प्रदाता की अनुपलब्धता के कारण विफलता न हो।
सिर्फ़ अनुमान से आगे बढ़ते हुए, HelixLLM एक पूर्ण एप्लिकेशन प्लेटफ़ॉर्म है: RAG ज्ञान पाइपलाइन (इंजेशन, चंकिंग, एम्बेडिंग, vector खोज) और टूल-कॉलिंग, वार्तालाप सत्र और RAG एकीकरण के साथ ReAct एजेंट प्रणाली उसी बाइनरी में शामिल हैं। मोड प्रणाली नेटवर्क स्तर पर भी लाभदायक है — full मोड में सभी परतें शून्य नेटवर्क ओवरहेड के साथ सीधे इन-प्रोसेस Go कॉल के माध्यम से संवाद करती हैं, जबकि वही बाइनरी, कई होस्ट पर विभाजित होने पर, gRPC, SSE और Kafka के माध्यम से समन्वय करती है। इसके अलावा, इसमें Brotli/gzip कंटेंट नेगोशिएशन, SSE स्ट्रीमिंग जो OpenAI और Anthropic प्रारूपों से बाइट-टू-बाइट मेल खाती है, API-की और JWT प्रमाणीकरण के साथ रेट लिमिटिंग, Prometheus मेट्रिक्स, OpenTelemetry ट्रेसिंग और उत्पादन बुनियादी ढाँचे के लिए Go सबमॉड्यूल का एक बड़ा सेट शामिल है।
सामग्री
टीमों को ऐसा अनुमान चाहिए जो पोर्टेबल हो, मानकों के अनुकूल हो और लचीला हो—बिना क्लाइंट को फिर से लिखे या किसी एक प्रदाता या मशीन पर निर्भर हुए। HelixLLM को इसलिए बनाया गया ताकि वही बाइनरी स्थानीय विकास के लिए चल सके और मल्टी-होस्ट प्रोडक्शन क्लस्टर तक स्केल हो सके, जो OpenAI और Anthropic डायलेक्ट्स का उपयोग करता हो, जिनसे क्लाइंट पहले से परिचित हैं।
यह संपूर्ण अनुमान स्टैक—गेटवे, स्थानीय अनुमान, क्लाउड फ़ॉलबैक, RAG और एजेंट—को एक ही बाइनरी में समाहित कर देता है, जिसे मोड स्विच द्वारा नियंत्रित किया जाता है। इससे आपका डिप्लॉयमेंट आर्किटेक्चर रनटाइम निर्णय बन जाता है, न कि प्लेटफ़ॉर्म बदलने का प्रोजेक्ट। और यह उस चीज़ को, जो पहले एक कमज़ोरी थी, एक विशेषता में बदल देता है: क्लाउड प्रदाता की विश्वसनीयता एक प्राथमिक, निरंतर मापी जाने वाली चिंता बन जाती है, जिसे एक स्कोर-आधारित, स्व-उपचारात्मक फ़ॉलबैक चेन द्वारा संभाला जाता है। यह हर कुछ मिनटों में प्रदाताओं को पुनः रैंक करता है और हमेशा गारंटीकृत स्थानीय अनुमान पर डिग्रेड करता है। इससे जो क्षमता खुलती है, वह एक ऐसा एकल एंडपॉइंट है जिस पर आप वास्तव में भरोसा कर सकते हैं—मानकों के अनुकूल, लैपटॉप से क्लस्टर तक पोर्टेबल, और कभी भी अंधेरा नहीं होता क्योंकि कोई अपस्ट्रीम प्रदाता रेट-लिमिट कर गया या विफल हो गया।
- एक ही बाइनरी जिसमें छह-मोड प्रणाली है, जो ऑल-इन-वन या वितरित भूमिकाओं में चलती है—
fullमोड में सीधे इन-प्रोसेस Go कॉल, और वितरित मोड में gRPC/SSE/Kafka—ताकि डिप्लॉयमेंट टोपोलॉजी बिना कोड बदलाव या अनावश्यक नेटवर्क टैक्स के बदली जा सके। - 7+ मुफ़्त प्रदाताओं के बीच एक स्कोर-आधारित, स्वतः खोजी जाने वाली मल्टी-प्रोवाइडर फ़ॉलबैक चेन, जिसे LLMsVerifier द्वारा निरंतर रैंक किया जाता है, जिसमें स्वचालित 429/5xx फ़ेलओवर और गारंटीकृत llama.cpp अंतिम विकल्प होता है—मुफ़्त टियर की क्षमता को विश्वसनीय क्षमता में बदलना।
- दोहरे OpenAI *और* Anthropic-संगत इंटरफ़ेस, जो HTTP/3 पर सर्व किए जाते हैं, जिसमें स्वचालित HTTP/2 फ़ॉलबैक होता है—ताकि दोनों पारिस्थितिकी तंत्रों के क्लाइंट बिना किसी बदलाव के जुड़ सकें।
- स्थानीय अनुमान जो CUDA, Metal और ROCm को एक ही कोडबेस से समर्थित करता है—वही बिल्ड Nvidia, Apple और AMD हार्डवेयर पर त्वरित रूप से चलता है।
- एक होस्ट से कई होस्ट तक स्केलिंग बिना रीराइट के। अधिकांश सिस्टम "स्थानीय विकास" और "वितरित प्रोडक्शन" के बीच एक कठोर सीमा खींचते हैं, और इसे पार करने का मतलब पुनः आर्किटेक्चर करना होता है। हमने इस सीमा को एक ही बाइनरी पर मोड प्रणाली के साथ मिटा दिया:
fullमोड में वही परतें सीधे इन-प्रोसेस कॉल के माध्यम से संवाद करती हैं और वितरित मोड में gRPC/SSE/Kafka पर पारदर्शी रूप से स्विच करती हैं—इसलिए स्केलिंग आउट एक कॉन्फ़िगरेशन बदलाव है, न कि पोर्टिंग। - अविश्वसनीय, रेट-लिमिटेड मुफ़्त क्लाउड प्रदाता। मुफ़्त टियर का अनुमान तेज़ होता है, जब तक कि वह 429 या अनुरोध के बीच में गायब न हो जाए। हमने इसे विश्वसनीय बनाया—उपलब्ध मॉडलों की स्वतः खोज करके, उन्हें LLMsVerifier से स्कोर करके, रेट-लिमिट हेडर को सक्रिय रूप से ट्रैक करके (ताकि थ्रॉटलिंग से पहले प्रदाताओं से दूर रूट किया जा सके), और स्वचालित रूप से रैंक की गई चेन के माध्यम से स्थानीय llama.cpp पर फ़ेलओवर करके—ताकि पूल की अस्थिरता कभी कॉलर तक न पहुँचे।
- दो पारिस्थितिकी तंत्रों में क्लाइंट संगतता। अनुमान बैकएंड अपनाने के लिए क्लाइंट को फिर से लिखना संभव नहीं है। हमने OpenAI *और* Anthropic API के दोनों रूपों को लागू किया—उनके अलग-अलग SSE स्ट्रीमिंग प्रारूपों तक—ताकि दोनों शिविरों के SDK HelixLLM की ओर इशारा करें और बस काम करें।
सामग्री
- Go + Gin — चुना गया क्योंकि एकल-बाइनरी, कंकरेंसी-प्रथम रनटाइम ही वह आधार है जो संपूर्ण मोड प्रणाली को संभव बनाता है: एक निर्माण जो लैपटॉप सर्वर या क्लस्टर भूमिका के रूप में काम कर सकता है। यह संपूर्ण प्रणाली और गेटवे की HTTP परत को साथ लेकर चलता है।
- HTTP/3 (QUIC) + TLS 1.3, HTTP/2 फ़ॉलबैक के साथ — आधुनिक, कम-विलंबता, कनेक्शन-लचीले परिवहन के लिए चुना गया, जिसे सर्वर सतह के रूप में उजागर किया गया है और स्वचालित वार्ता के साथ ताकि वे क्लाइंट जो QUIC नहीं कर पाते, चुपचाप HTTP/2 पर आ जाते हैं।
- llama.cpp (CUDA/Metal/ROCm) — पोर्टेबल स्थानीय अनुमान के लिए चुना गया जो एक ही कोडबेस से Nvidia, Apple और AMD बैकएंड पर त्वरण प्रदान करता है; यह गारंटीकृत अंतिम विकल्प प्रदाता के रूप में भी काम करता है जो फ़ॉलबैक श्रृंखला को कभी विफल नहीं होने देता।
- LLMsVerifier — चुना गया ताकि "इस समय कौन सा प्रदाता अच्छा है" को एक संख्या में बदला जा सके; यह क्लाउड फ़ॉलबैक श्रृंखला को 5-मिनट के अंतराल पर स्कोर और रैंक करता है ताकि रूटिंग लाइव गुणवत्ता के आधार पर हो, पुराने अनुमानों पर नहीं।
- क्लाउड प्रदाता (Chutes, OpenRouter, HuggingFace, Nvidia, Cerebras, SambaNova, Together) — कई अपस्ट्रीम से मुफ़्त-स्तरीय क्षमता का लाभ उठाने के लिए चुने गए; स्वचालित रूप से खोजे और एकल फ़ेलओवर श्रृंखला में रैंक किए जाते हैं ताकि कोई भी प्रदाता विफलता का एकल बिंदु न बने।
- gRPC + SSE + Kafka — वितरित परिनियोजन के लिए अंतर-मोड परिवहन के रूप में चुने गए: gRPC सेवा-से-सेवा कॉल के लिए, SSE स्ट्रीमिंग के लिए, और Kafka भूमिकाओं के बीच डिकपल्ड इवेंट प्रवाह के लिए।
- वेक्टर स्टोर / embeddings — RAG ज्ञान पाइपलाइन को शुरू से अंत तक शक्ति प्रदान करने के लिए चुना गया: दस्तावेज़ों को ग्रहण करना, टुकड़ों में बाँटना, एम्बेड करना और खोजना, जो मॉडल के उत्तरों को आधार प्रदान करते हैं।
- Prometheus + OpenTelemetry — मेट्रिक्स और वितरित ट्रेसिंग के लिए चुने गए जो किसी अनुरोध का अनुसरण उस मोड तक करते हैं जहाँ भी उसे परिनियोजित किया गया हो।
- vasic-digital Go सबमॉड्यूल — कठोर उत्पादन-बुनियादी ढाँचे के प्रिमिटिव का पुनः उपयोग करने के लिए चुने गए, ताकि प्रणाली का आधार व्यापक स्टैक के अनुरूप बना रहे।
- स्थिति: बीटा। कार्यात्मक, सक्रिय रूप से विकसित वितरित अनुमान प्रणाली।
- लाइसेंस: निर्धारित नहीं। रिपॉजिटरी अपने मेटाडेटा (
licenseInfoशून्य) में कोई लाइसेंस घोषित नहीं करती — यह अपुष्ट है और लाइसेंस बताने से पहले इसे सुलझाया जाना चाहिए। - वर्तमान में कैनोनिकल रिपॉजिटरी
github.com/HelixDevelopment/llmपर निर्देशित होती है;HelixLLMपथ उस पर पुनर्निर्देशित करता है। README में कवरेज-थ्रेशोल्ड और सबमॉड्यूल-काउंट के आँकड़े स्व-रिपोर्टेड हैं।
प्राथमिकता स्तर: Helix-प्राथमिक।