विषय-सूची
बाहरी AI में न डाली जा सकने वाली गोपनीय जानकारी: क्या ऐसा हो रहा है?
पता है कि AI से काम जल्दी होगा। पर यह बातचीत कंपनी से बाहर नहीं जा सकती।
निजी AI अकाउंट से गुमनाम करवाई, तो सूचना सुरक्षा टीम का कॉल आया। अब रिपोर्ट लिखनी पड़ी।
लीगल ने कहा "बाहरी AI को नहीं भेज सकते"। फ़ायदा पता है, फिर भी काम आगे नहीं बढ़ता।
Ollama से टेस्ट हो गया। पर कौन-कौन जुड़ सकता है, यह समझा नहीं सकते।
बाहर नहीं भेज सकते, इसलिए AI इस्तेमाल नहीं करते। इन दो विकल्पों के बीच एक रास्ता है: "अपने सर्वर पर चलाना"।
* 1 और 2, व्याख्या वीडियो में बताए गए मामलों पर आधारित उदाहरण हैं (वीडियो में क्या कहा गया)।
असल में यह चाहिए था: गोपनीयता बनाए रखते हुए अपने Qwen पर
वही दस्तावेज़, वही मीटिंग। AI को सौंपें, फिर भी डेटा कंपनी से बाहर न जाए।
डेटा कंपनी के सर्वर से बाहर नहीं जाता। बाहरी AI में पेस्ट करने की ज़रूरत नहीं।
कहाँ सुनता है, ऑथेंटिकेशन, बाहरी ट्रैफ़िक, लॉग। हर जगह कहाँ रोका, दिखा सकते हैं।
डाउनलोड, जाँच, रजिस्टर, प्रोडक्शन। तय क्रम, कोई भी करे तो वही स्टेप।
"क्या इस वर्ज़न पर जाएँ?" पहले-बाद की तुलना तैयार, तय करना बस यही एक सवाल।
यहाँ तक का काम इस पेज के स्टेप और चेकलिस्ट से बन जाता है। मीटिंग के बाद के काम समेत बँटवारा कैसे करें, यह SIMY से संबंध में है।
लोकल LLM क्या है: Qwen को कंपनी के अंदर चलाने की वजह
लोकल LLM का मतलब है, सार्वजनिक रूप से जारी मॉडल के वेट्स को अपने PC या कंपनी के सर्वर पर चलाना। आपका डाला गया टेक्स्ट उस मशीन से बाहर नहीं जाता।
| नाम | कहाँ चलता है | किस काम के लिए |
|---|---|---|
| लोकल LLM | अपना PC (Mac या Windows) | अकेले आज़माना, ऑफ़लाइन इस्तेमाल |
| ऑन-प्रेम LLM, इन-हाउस LLM | कंपनी के सर्वर या डेटा सेंटर | विभाग या पूरी कंपनी में एक साथ इस्तेमाल |
| बंद नेटवर्क का LLM | इंटरनेट से न जुड़े नेटवर्क के अंदर | गोपनीयता दायित्व, निजी जानकारी, डिज़ाइन डेटा |
लोकल LLM से क्या-क्या कर सकते हैं
- गोपनीय दस्तावेज़ों का सारांश और ड्राफ़्ट: मीटिंग नोट्स, कॉन्ट्रैक्ट, डिज़ाइन डॉक्यूमेंट, ग्राहकों से बातचीत।
- अंदरूनी दस्तावेज़ों में खोज और सवाल-जवाब (RAG): कंपनी के नियम और प्रक्रिया-पुस्तिका पढ़ाकर सवालों के जवाब दिलवाना।
- अनुवाद और कोड में मदद: चीनी, अंग्रेज़ी और हिन्दी के बीच अनुवाद, अंदरूनी कोड की व्याख्या और सुधार के सुझाव।
छोटे मॉडल बड़े क्लाउड मॉडल जितने समझदार नहीं होते। इन्हें अंतिम वर्ज़न के बजाय "पहला ड्राफ़्ट" बनाने के लिए इस्तेमाल करें, तो उम्मीद और नतीजे में कम फ़र्क़ रहता है।
Qwen ही क्यों
- Apache 2.0 वाले मॉडल हैं
- कई भाषाएँ
- आकार चुन सकते हैं
- लाइसेंस: Qwen3 और Qwen3.8-27B जैसे कई मॉडल Apache 2.0 के तहत जारी हैं। लेकिन सभी नहीं (नीचे की तालिका देखें)।
- भाषाएँ: Qwen3 पीढ़ी की घोषणा में 119 भाषाओं और बोलियों के समर्थन का दावा है।
- आकार: PC पर चलने वाले 0.6B से 8B तक, क्वांटाइज़ करने पर एक GPU में समाने वाले 27B से 32B, और कई GPU माँगने वाले 235B तक।
हर मॉडल का लाइसेंस अलग है
तालिका को बगल में स्क्रॉल कर सकते हैं →
| मॉडल | लाइसेंस | कितना पुष्ट |
|---|---|---|
| Qwen3 (0.6B से 32B, 30B-A3B, 235B-A22B-2507), Qwen3-VL, Qwen3-Coder, Qwen3-Embedding और Reranker | Apache 2.0 | Hugging Face पर पुष्ट |
| Qwen3.5 (0.8B से 35B-A3B), Qwen3.6 (27B, 35B-A3B), Qwen3.8-27B (FP8 वर्ज़न सहित) | Apache 2.0 | Hugging Face पर पुष्ट |
| Qwen2.5 के ज़्यादातर मॉडल (0.5B से 32B, Coder 7B और 14B, VL-7B) | Apache 2.0 | Hugging Face पर पुष्ट |
| Qwen2.5-3B, Qwen2.5-VL-3B | qwen-research (रिसर्च के लिए; व्यावसायिक उपयोग अलग शर्तों पर) | सिर्फ़ नाम पुष्ट; शर्तें जाँचनी होंगी |
| Qwen2.5-72B-Instruct, Qwen2.5-VL-72B | qwen (अपना लाइसेंस) | सिर्फ़ नाम पुष्ट; शर्तें जाँचनी होंगी |
| Qwen3.8-2.4T-A95B | अपना लाइसेंस | Hugging Face पर पुष्ट |
| Qwen3.8-Flash-Next | qwen-community-1.0। MaaS के रूप में देने या कोडिंग, ऑफ़िस सहायता जैसे "AI work assistant" उपयोग के लिए अलग लाइसेंस चाहिए, ऐसा बताया गया है | सारांश से पुष्ट; लीगल की जाँच ज़रूरी |
1 अक्टूबर 2026 को Hugging Face पर Qwen संगठन की मॉडल जानकारी से जाँचा गया। "Qwen है तो सब Apache 2.0" सही नहीं है। व्यावसायिक उपयोग से पहले, जिस मॉडल को इस्तेमाल करेंगे उसकी रिपॉज़िटरी की LICENSE फ़ाइल लीगल टीम के साथ जाँच लें।
लोकल LLM के सुझाव: काम के हिसाब से Qwen कैसे चुनेंअक्टूबर 2026 तक; उलझन हो तो छोटे से शुरू करें
- पहले PC पर आज़माएँ: Qwen3 के 4B से 8B या Qwen3.5 के छोटे मॉडल। ये Ollama या LM Studio में चलते हैं, और आप देख सकते हैं कि काम में मदद मिलती है या नहीं।
- विभाग स्तर पर सारांश और ड्राफ़्ट: Qwen3-14B या 32B, या Qwen3.8-27B। FP8 या 4bit वर्ज़न एक GPU में समा जाते हैं, और इमेज भी संभालने वाला 3.8-27B है।
- कोड में मदद: Qwen3-Coder (30B-A3B)। कम सक्रिय पैरामीटर वाला MoE है, इसलिए आकार के हिसाब से तेज़ चलता है।
- अंदरूनी दस्तावेज़ों में खोज: जवाब देने वाले मॉडल के साथ Qwen3-Embedding और Reranker जोड़ें।
पहले एक काम तय करके आज़माएँ, तो समझना आसान होता है कि कौन-सा आकार काफ़ी है। बड़ा GPU ख़रीदने से पहले, अपने मौजूदा PC पर देख लें कि "पहले ड्राफ़्ट" के लिए काम चलता है या नहीं, यही सबसे छोटा रास्ता है।
Qwen का ख़ुद का इस्तेमाल (Qwen Chat, API, मुख्य मॉडल) Qwen उपयोग गाइड में है, और दूसरे चीनी मॉडल से तुलना चीनी AI (LLM) की तुलना में।
इन्फ़रेंस इंजन का चुनाव: Ollama, llama.cpp, vLLM, SGLang, LM Studio
मॉडल को चलाने वाला सॉफ़्टवेयर "इन्फ़रेंस इंजन" कहलाता है। सुरक्षा के लिहाज़ से सबसे बड़ा फ़र्क़ यह है कि कुछ न बदलें तो वह कहाँ सुनता है।
तालिका को बगल में स्क्रॉल कर सकते हैं →
| इंजन | डिफ़ॉल्ट रूप से कहाँ सुनता है | अपना ऑथेंटिकेशन | TLS | बाहर का ट्रैफ़िक | किस काम के लिए |
|---|---|---|---|---|---|
| Ollama | 127.0.0.1:11434 | आधिकारिक FAQ में ज़िक्र नहीं; प्रॉक्सी से करें | नहीं; प्रॉक्सी पर ख़त्म करें | क्लाउड फ़ीचर OLLAMA_NO_CLOUD=1 से बंद। Mac और Windows वर्ज़न अपने-आप अपडेट लेने जाते हैं | व्यक्तिगत या छोटी टीम का ट्रायल, Mac |
| llama.cpp (llama-server) | 127.0.0.1:8080 | --api-key, --api-key-file | --ssl-key-file, --ssl-cert-file | --offline से नेटवर्क जाँच बंद | अकेले इस्तेमाल, GGUF, CPU, Apple, AMD |
| vLLM | --host छोड़ दें तो सभी इंटरफ़ेस (पोर्ट 8000) | --api-key या VLLM_API_KEY। सुरक्षा सिर्फ़ /v1 जैसे कुछ हिस्सों को | --ssl-keyfile, --ssl-certfile | उपयोग के आँकड़े डिफ़ॉल्ट रूप से भेजता है। VLLM_NO_USAGE_STATS=1 से बंद | विभाग या पूरी कंपनी में बहुत से लोगों का एक साथ प्रोडक्शन इस्तेमाल |
| SGLang | 127.0.0.1:30000 | --api-key। एडमिन के लिए --admin-api-key | प्रॉक्सी पर ख़त्म करना सुरक्षित | मॉडल डाउनलोड HF_HUB_OFFLINE=1 से बंद | एजेंट उपयोग, एक ही लंबे प्रॉम्प्ट का बार-बार इस्तेमाल |
| LM Studio | सिर्फ़ अपना PC (पोर्ट 1234)। LAN पर खोलना सेटिंग से | आधिकारिक डॉक्यूमेंटेशन देखें | नहीं | आधिकारिक डॉक्यूमेंटेशन देखें | स्क्रीन पर आज़माना, Mac या निजी PC |
अक्टूबर 2026 तक हर इंजन के आधिकारिक डॉक्यूमेंटेशन (vLLM के लिए सोर्स कोड भी) से जाँचा गया। LM Studio की पंक्ति में जो पूरी तरह पुष्ट नहीं हो सका, वहाँ "आधिकारिक डॉक्यूमेंटेशन देखें" लिखा है।
- पहले जाँचें: llama.cpp या Ollama से देखें कि काम में फ़ायदा है या नहीं।
- पूरी कंपनी में इस्तेमाल: vLLM। बहुत से लोग एक साथ इस्तेमाल करें, तब भी रफ़्तार कम नहीं गिरती।
- एजेंट एक ही लंबा निर्देश बार-बार भेजें: SGLang।
vLLM पर ध्यान दें: आधिकारिक Security पेज बताता है कि --api-key सिर्फ़ /v1 जैसे हिस्सों को बचाता है, और /invocations या /pooling जैसे एंडपॉइंट इसके दायरे में नहीं आते। इसीलिए, जिन एंडपॉइंट को खोलना है सिर्फ़ उन्हें पास करने वाली रिवर्स प्रॉक्सी के पीछे रखना, आधिकारिक तौर पर भी सबसे असरदार उपाय माना गया है।
हार्डवेयर का अंदाज़ा: हर Qwen मॉडल के लिए ज़रूरी GPU मेमोरी
ज़रूरी GPU मेमोरी को तीन चीज़ों का जोड़ मानें।
- वेट्सपैरामीटर की संख्या × प्रति पैरामीटर बाइट (BF16 में 2, FP8 में 1, 4bit में लगभग 0.5)
- + KV कैशकॉन्टेक्स्ट की लंबाई × एक साथ इस्तेमाल करने वालों के अनुपात में
- + गुंजाइशचलते समय का वर्क एरिया
तालिका को बगल में स्क्रॉल कर सकते हैं →
| मॉडल | BF16 | FP8 | 4bit (INT4 आदि) | स्रोत |
|---|---|---|---|---|
| Qwen3-8B | लगभग 16GB | लगभग 9.3GB | लगभग 6.2GB | Qwen का आधिकारिक स्पीड बेंचमार्क |
| Qwen3-14B | लगभग 28GB | लगभग 16GB | लगभग 10GB | ऊपर जैसा |
| Qwen3-32B | लगभग 63GB | लगभग 33GB | लगभग 19GB | ऊपर जैसा |
| Qwen3-235B-A22B | 8 GPU | 4 GPU | 4 GPU (GPTQ-INT4) | ऊपर जैसा (SGLang पर कॉन्फ़िगरेशन) |
| Qwen3.8-27B | लगभग 54GB (सिर्फ़ वेट्स, गणना से अंदाज़ा) | लगभग 27GB (गणना से)। आधिकारिक FP8 वर्ज़न का एक माप लगभग 28.8GB | लगभग 14GB (गणना से)। असली फ़ाइल 17 से 18GB के आसपास (Ollama वर्ज़न का डाउनलोड लगभग 18GB) | पैरामीटर संख्या से गणना, एक माप का उदाहरण, Ollama लाइब्रेरी |
Qwen3 के आँकड़े Qwen के आधिकारिक स्पीड बेंचमार्क से हैं (transformers में छोटा इनपुट प्रोसेस करने पर शुरुआत के तुरंत बाद की GPU मेमोरी)। Qwen3.8-27B की आधिकारिक तालिका नहीं है, इसलिए ये पैरामीटर संख्या से निकाला अंदाज़ा और एक व्यक्ति का माप है, KV कैश शामिल नहीं। क्वांटाइज़ेशन वर्ज़न और कॉन्टेक्स्ट की लंबाई से ज़रूरत काफ़ी बदलती है (अक्टूबर 2026 तक)।
- Qwen3.8-27B और 32GB GPU: BF16 में सिर्फ़ वेट्स लगभग 54GB (गणना से अंदाज़ा) हैं, इसलिए एक RTX 5090 (32GB) में नहीं समाते। आधिकारिक FP8 वर्ज़न के भी सिर्फ़ वेट्स लगभग 28.8GB हैं, और पूरा कॉन्टेक्स्ट लेने पर 32GB में न समाने का अनुमान बताया गया है। 4bit वर्ज़न लें या कॉन्टेक्स्ट की सीमा घटाएँ।
- 16GB के 2 GPU, 32GB के 1 GPU के बराबर नहीं: दो में बाँटने पर कार्डों के बीच का संचार और हर कार्ड पर ज़रूरी वर्क एरिया, नुक़सान बढ़ाते हैं।
- लंबे कॉन्टेक्स्ट में इंतज़ार बढ़ता है: एक व्यक्ति के माप में, लगभग 2.5 लाख टोकन के इनपुट पर पहला अक्षर आने में 4 मिनट से ज़्यादा लगे।
- Mac: Apple silicon मेमोरी को GPU के साथ साझा करता है। मॉडल फ़ाइल से काफ़ी ज़्यादा मेमोरी चाहिए।
आकार कैसे तय करें: पहले तय करें कि एक साथ कितने लोग इस्तेमाल करेंगे और एक बार में कितना लंबा दस्तावेज़ पढ़ाया जाएगा। KV कैश इन दोनों के अनुपात में बढ़ता है, इसलिए सिर्फ़ वेट्स के हिसाब से सोचेंगे तो प्रोडक्शन में मेमोरी कम पड़ेगी।
बंद नेटवर्क में सेटअप के स्टेप: Qwen + vLLM कंपनी के सर्वर पर
उदाहरण में Qwen3.8-27B का FP8 वर्ज़न, vLLM (Docker) और Linux सर्वर है। कमांड अक्टूबर 2026 के आधिकारिक डॉक्यूमेंटेशन के मुताबिक़ हैं। GPU मेमोरी कम पड़े तो कॉन्टेक्स्ट की सीमा (--max-model-len) घटाएँ या 4bit वर्ज़न चुनें।
* ढाँचा केवल समझाने के लिए एक उदाहरण है
कमांड कैसे पढ़ें: <जाँचा हुआ कमिट SHA> की तरह कोण-कोष्ठक वाले हिस्से अपनी कंपनी के मान से बदलें। वर्ज़न नंबर अक्टूबर 2026 के उदाहरण हैं।
-
वर्ज़न तय करके मॉडल डाउनलोड करें
लाने वाला टर्मिनल (इंटरनेट की तरफ़)आधिकारिक
Qwen/संगठन की रिपॉज़िटरी से, कमिट तय करके डाउनलोड करें। इन्फ़रेंस इंजन का कंटेनर भी वर्ज़न तय करके सेव करें।bashpip install -U huggingface_hub hf download Qwen/Qwen3.8-27B-FP8 \ --revision <जाँचा हुआ कमिट SHA> \ --local-dir ./Qwen3.8-27B-FP8 docker pull vllm/vllm-openai:v0.30.0 docker inspect --format '{{index .RepoDigests 0}}' vllm/vllm-openai:v0.30.0 docker save vllm/vllm-openai:v0.30.0 -o vllm-openai-v0.30.0.tardocker inspectजो डाइजेस्ट दिखाता है (sha256:से शुरू होने वाला मान), उसे रजिस्टर में लिख लें।वर्ज़न तय करने की वजह: एक ही रिपॉज़िटरी में नए रिवीज़न से अंदर की चीज़ें बदल सकती हैं। एक क्वांटाइज़्ड वर्ज़न में नए रिवीज़न से स्पेक्युलेटिव डिकोडिंग की लेयर (MTP) हटा दी गई और स्पीड-अप चलना बंद हो गया, ऐसा बताया गया है।
-
SHA-256 का रजिस्टर बनाएँ
लाने वाला टर्मिनलHugging Face API जो
lfs.oidदेता है, वह बड़ी फ़ाइलों (LFS) का SHA-256 है। इस मान को अपनी फ़ाइलों से मिलाएँ।bash# Hugging Face की तरफ़ के मान निकालें (सिर्फ़ LFS फ़ाइलें) curl -s "https://huggingface.co/api/models/Qwen/Qwen3.8-27B-FP8/tree/<जाँचा हुआ कमिट SHA>?recursive=true&expand=true" \ | jq -r '.[] | select(.lfs) | "\(.lfs.oid) ./\(.path)"' > HF.sha256 # अपनी फ़ाइलों से मिलाएँ और सभी फ़ाइलों का रजिस्टर बनाएँ cd Qwen3.8-27B-FP8 sha256sum -c ../HF.sha256 find . -type f ! -path './.cache/*' -print0 | sort -z | xargs -0 sha256sum > ../MODEL.sha256 cd .. && sha256sum vllm-openai-v0.30.0.tar > IMAGE.sha256रजिस्टर पर, डाउनलोड करने वाले से अलग कोई दूसरा ज़िम्मेदार व्यक्ति पुष्टि के हस्ताक्षर करे (हस्ताक्षर का तरीक़ा कंपनी के मानक के अनुसार)।
-
मीडिया से अंदर लाएँ, लोड करने से पहले जाँचें
बंद नेटवर्क का सर्वररजिस्टर और फ़ाइलें मीडिया से ले जाएँ और बंद नेटवर्क की तरफ़ फिर से मिलाएँ। एक भी पंक्ति में
FAILEDआए तो इस्तेमाल न करें।bashcd /srv/llm/models/Qwen3.8-27B-FP8 && sha256sum -c /srv/llm/incoming/MODEL.sha256 cd /srv/llm/incoming && sha256sum -c IMAGE.sha256 docker load -i vllm-openai-v0.30.0.tar -
सिर्फ़ 127.0.0.1 पर सुनने के लिए चालू करें
बंद नेटवर्क का सर्वरvLLM में
--hostछोड़ दें तो वह सभी इंटरफ़ेस पर सुनता है।--host 127.0.0.1हमेशा लिखें, और की (key) फ़ाइल से दें (कमांड लाइन पर लिखेंगे तोpsमें दिख जाएगी)।bash · vLLM (Docker)# की वाली फ़ाइल बनाएँ और अनुमति 600 करें sudo install -D -m 600 /dev/null /etc/llm/vllm.env echo "VLLM_API_KEY=$(openssl rand -hex 32)" | sudo tee /etc/llm/vllm.env > /dev/null sudo docker run -d --name qwen --gpus all --ipc=host --network host \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 \ --served-model-name qwen3.8-27b \ --host 127.0.0.1 --port 8000 \ --max-model-len 65536 --gpu-memory-utilization 0.90 # पक्का करें कि सिर्फ़ 127.0.0.1:8000 पर सुन रहा है ss -ltnp | grep 8000--trust-remote-codeन लगाएँ। ताकि मॉडल के साथ आया कोड न चले।VLLM_SERVER_DEV_MODE=1प्रोडक्शन में इस्तेमाल न करें। इससे डेवलपमेंट वाले एंडपॉइंट खुल जाते हैं।- थिंकिंग मोड और टूल कॉल: Qwen के आधिकारिक डॉक्यूमेंटेशन में Qwen3 के उदाहरण के तौर पर
--reasoning-parser qwen3और--enable-auto-tool-choice --tool-call-parser hermesदिए गए हैं। 3.8 पीढ़ी के लिए क्या लिखना है, मॉडल कार्ड में देखें।
bash · Ollama के लिए (systemd)sudo systemctl edit ollama # खुली फ़ाइल में नीचे की 3 पंक्तियाँ लिखकर सेव करें [Service] Environment="OLLAMA_HOST=127.0.0.1:11434" Environment="OLLAMA_NO_CLOUD=1" sudo systemctl restart ollamabash · SGLang और llama.cpp के लिएpython3 -m sglang.launch_server --model-path /models/Qwen3.8-27B-FP8 \ --host 127.0.0.1 --port 30000 --api-key <की> --admin-api-key <एडमिन की> llama-server -m /models/qwen.gguf --host 127.0.0.1 --port 8080 \ --api-key-file /etc/llm/keys --offline --no-webui --jinjaSGLang के उदाहरण में भी की सीधे न लिखें; असल में फ़ाइल या एनवायरनमेंट वेरिएबल से दें। मॉडल कार्ड के उदाहरण में
--host 0.0.0.0है, इसलिए उसे जस का तस कॉपी न करें। -
nginx से TLS, अनुमति-सूची और ऑथेंटिकेशन लगाएँ
बंद नेटवर्क का सर्वर (गेटवे)उपयोगकर्ता सिर्फ़ nginx तक पहुँचें।
/v1में से सिर्फ़ ज़रूरी एंडपॉइंट पास करें, बाक़ी पर 404 लौटाएँ।nginxserver { listen 443 ssl; server_name llm.internal.example; ssl_certificate /etc/pki/llm.crt; ssl_certificate_key /etc/pki/llm.key; ssl_protocols TLSv1.2 TLSv1.3; allow 10.20.0.0/16; # सिर्फ़ अंदरूनी सेगमेंट deny all; location = /v1/chat/completions { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <अपस्ट्रीम की>"; proxy_pass http://127.0.0.1:8000; proxy_buffering off; # स्ट्रीमिंग जवाब के लिए } location = /v1/models { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <अपस्ट्रीम की>"; proxy_pass http://127.0.0.1:8000; } location = /_auth { internal; proxy_pass http://127.0.0.1:4180/oauth2/auth; # oauth2-proxy आदि से कंपनी के IdP से जोड़ें } location / { return 404; } # /metrics या /invocations जैसे एंडपॉइंट बाहर न दें }उपयोगकर्ता कंपनी के SSO (OIDC या SAML) से पहचान साबित करें, और अपस्ट्रीम API की उपयोगकर्ताओं को न बाँटें।
auth_requestnginx का मॉड्यूल है; आपके बिल्ड में है या नहीं,nginx -Vसे देख सकते हैं। -
बाहर जाने वाला ट्रैफ़िक बंद करें
बंद नेटवर्क का सर्वरसर्वर से इंटरनेट का सारा ट्रैफ़िक डिफ़ॉल्ट रूप से बंद करें। अनुमति सिर्फ़ अंदरूनी DNS, समय सिंक और लॉग सर्वर को।
bash · ufwsudo ufw default deny incoming sudo ufw default deny outgoing sudo ufw allow in on <एडमिन IF> to any port 22 proto tcp # पहले अनुमति न दी तो SSH कट जाएगा sudo ufw allow in on <अंदरूनी IF> to any port 443 proto tcp sudo ufw allow out to <अंदरूनी DNS> port 53 proto udp sudo ufw allow out to <अंदरूनी NTP> port 123 proto udp sudo ufw allow out to <लॉग सर्वर> port 514 proto tcp sudo ufw enable # पक्का करें कि बाहर नहीं जा सकते (फ़ेल हो तो सही है) curl -m 5 https://huggingface.coDocker के
-pसे पोर्ट खोलने पर Docker ख़ुद पैकेट के नियम जोड़ देता है, इसलिए ufw से बंद समझने के बावजूद बाहर से पहुँच सकते हैं। इन स्टेप में--network hostऔर--host 127.0.0.1से सुनना सिर्फ़ लोकल तक सीमित किया गया है।bash · -p इस्तेमाल करते समय# होस्ट की तरफ़ सिर्फ़ 127.0.0.1 पर खोलें (-p 8000:8000 सभी इंटरफ़ेस पर खोल देता है) sudo docker run -d --name qwen --gpus all --ipc=host \ -p 127.0.0.1:8000:8000 \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 --served-model-name qwen3.8-27b \ --host 0.0.0.0 --port 8000 --max-model-len 65536 # ↑ कंटेनर के अंदर 0.0.0.0 पर सुनता है, होस्ट की तरफ़ सिर्फ़ 127.0.0.1 पर दिखता हैइस तरीक़े में कंटेनर के अंदर vLLM
0.0.0.0पर सुनता है, पर होस्ट के बाहर से नहीं पहुँचा जा सकता। नेटवर्क के फ़ायरवॉल पर भी बाहर का ट्रैफ़िक बंद करें। -
लॉग और ऑडिट रखें
गेटवे, मॉनिटरिंगकिसने, कब, कौन-सा एंडपॉइंट इस्तेमाल किया, यह nginx के लॉग में रखें और कंपनी के लॉग प्लेटफ़ॉर्म (SIEM आदि) पर भेजें। टोकन की गिनती, सिर्फ़ मॉनिटरिंग नेटवर्क पर खोले गए
/metrics(Prometheus फ़ॉर्मेट) से करें।nginx · http { } के अंदरlog_format llm '$time_iso8601 user=$user ip=$remote_addr "$request" ' 'status=$status bytes=$body_bytes_sent rt=$request_time'; access_log /var/log/nginx/llm.log llm;vLLM में
--enable-log-requestsचालू करके DEBUG लेवल रखें, तो प्रॉम्प्ट का पूरा टेक्स्ट लॉग में रहता है। टेक्स्ट रखना है या नहीं और कितने समय तक, यह निजी जानकारी और गोपनीयता के नियमों के हिसाब से तय करें। -
उपयोगकर्ता और अनुमतियाँ तय करें
स्क्रीन (Open WebUI आदि)स्क्रीन पर चैट से इस्तेमाल करना हो, तो Open WebUI जैसा फ़्रंटएंड उसी बंद नेटवर्क में रखें, और रोल व ग्रुप के हिसाब से इस्तेमाल होने वाले मॉडल बाँटें। नौकरी छोड़ने वालों की पहुँच कंपनी के IdP पर ही बंद हो, ऐसा रखें।
env · Open WebUIOFFLINE_MODE=true ENABLE_SIGNUP=false DEFAULT_USER_ROLE=pending ENABLE_COMMUNITY_SHARING=falseOFFLINE_MODEचालू करने पर, अगर एम्बेडिंग मॉडल पहले से नहीं डाला, तो दस्तावेज़ खोज (RAG) नहीं चलेगी। एम्बेडिंग मॉडल भी स्टेप 1 से 3 वाले तरीक़े से ही अंदर लाएँ। -
अपडेट का तरीक़ा पहले से तय करें
लाने वाला टर्मिनल → टेस्ट एनवायरनमेंट → प्रोडक्शनvLLM लगभग हर 2 हफ़्ते में रिलीज़ होता है, और लगभग हर बार सुरक्षा सुधार शामिल होते हैं। बंद नेटवर्क में भी "डाउनलोड → जाँच → रजिस्टर → प्रोडक्शन" के क्रम से नियमित अपडेट करें।
bash# 1. नया वर्ज़न स्टेप 1 से 3 की तरह डाउनलोड करें, मिलाएँ और अंदर लाएँ # 2. टेस्ट एनवायरनमेंट में पुराने और नए वर्ज़न से एक ही सवाल पूछकर तुलना करें # 3. इस्तेमाल हो रहे एनवायरनमेंट वेरिएबल के नाम निकालें, और रिलीज़ नोट्स से मिलाएँ कि नए वर्ज़न में हटे तो नहीं sudo docker inspect --format '{{range .Config.Env}}{{println .}}{{end}}' qwen \ | grep -E '^(VLLM_|HF_)' | cut -d= -f1 # 4. प्रोडक्शन में डालने के बाद, किसने कब अपडेट किया और कब वापस किया, एक पंक्ति में दर्ज करें echo "$(date -I) vllm <पुराना वर्ज़न>→<नया वर्ज़न> ज़िम्मेदार:<नाम> जाँच:OK वापसी:<पुराना वर्ज़न>.tar" >> /srv/llm/CHANGELOGपिछले वर्ज़न का कंटेनर और मॉडल, डाइजेस्ट नोट करके रखें ताकि वापस जा सकें। कॉन्टेक्स्ट की सीमा जैसे, वर्ज़न के साथ बदलने वाले मान पहले और बाद में मिलाएँ।
लोकल LLM सुरक्षा चेकलिस्ट: प्रोडक्शन से पहले 20 पॉइंट
सेटअप से पहले और बाद में, ऊपर से क्रम से जाँचें। टिक सिर्फ़ इसी स्क्रीन पर काम करते हैं और कहीं नहीं भेजे जाते।
0 / 20 जाँचे गए
मॉडल और कंटेनर डाउनलोड
सुनने की जगह और बाहर का ट्रैफ़िक
प्रवेश और ऑथेंटिकेशन
अनुमतियाँ, रिकॉर्ड और संचालन
आम ग़लतियाँ: लोकल LLM में "मान लिया था" से बनने वाले छेद
बाईं तरफ़ आम ग़लती, दाईं तरफ़ इस पेज के स्टेप से उसका उपाय।
--host 0.0.0.0और ऑथेंटिकेशन नहींसैंपल की स्टार्ट कमांड जस की तस चलाकर पूरे LAN पर खोल देना।127.0.0.1+ nginxसुनना सिर्फ़ लोकल पर। उपयोगकर्ता गेटवे से होकर आते हैं।- अनजान स्रोत का बदला हुआ वर्ज़न"Uncensored" जैसे कम्युनिटी GGUF, इतिहास जाँचे बिना इस्तेमाल करना।आधिकारिक
Qwen/से, SHA तय करकेतीसरे पक्ष का वर्ज़न लें तो बनाने वाला और तरीक़ा दर्ज करें। - "api-key लगा दी, अब सुरक्षित"मान लेना कि vLLM की की सभी एंडपॉइंट को बचाती है।अनुमति-सूची से सीमित करेंसिर्फ़
/v1/chat/completionsजैसे ज़रूरी एंडपॉइंट पास करें। - "ऑन-प्रेम है, तो सुरक्षित"कंपनी के अंदर है, इसलिए अनुमतियाँ, लॉग और RAG का एक्सेस कंट्रोल छोड़ देना।अंदर भी, बाहर जैसा नियंत्रणSSO, रोल, लॉग, और देखने के अधिकार के हिसाब से खोज।
- टनल से बाहर से इस्तेमालअंदरूनी इस्तेमाल के लिए बना है, फिर भी Cloudflare Tunnel जैसे टूल से बाहर खोल देना।सिर्फ़ कंपनी के नेटवर्क सेबाहर से इस्तेमाल ज़रूरी हो तो कंपनी के आधिकारिक रिमोट कनेक्शन से।
- डिफ़ॉल्ट बाहरी ट्रैफ़िक पर ध्यान नहींvLLM के उपयोग के आँकड़े, Ollama डेस्कटॉप वर्ज़न का ऑटो-अपडेट।एनवायरनमेंट वेरिएबल और आउटबाउंड ब्लॉक, दोनोंसेटिंग से भी रोकें, फ़ायरवॉल से भी।
- छोटे मॉडल पर ज़रूरत से ज़्यादा भरोसाएजेंट या टूल कॉल में, न मौजूद फ़ाइलें या लिंक बना देना।पहले ड्राफ़्ट के रूप में इस्तेमालचलाना सैंडबॉक्स में, नतीजा इंसान जाँचे।
- अपडेट से टूटनावर्ज़न बढ़ाते ही हटे हुए एनवायरनमेंट वेरिएबल या बदली सीमा से बंद हो जाना।टेस्ट एनवायरनमेंट में पहले-बाद की तुलनारिलीज़ नोट्स से मिलाएँ, किसने अपडेट किया दर्ज करें।
वीडियो में क्या कहा गया: Qwen सेल्फ़-होस्टिंग के असली उदाहरण
फ़रवरी से अक्टूबर 2026 के बीच जारी अंग्रेज़ी, चीनी और जापानी के 18 व्याख्या वीडियो, उनकी ऑडियो ट्रांसक्रिप्ट तक जाँचे।
18 वीडियो में क्या कहा गया8 दृश्य, और पूरे से दिखने वाली बातें
बातों से: 8 दृश्य
- एक बैंक में क्या हुआ (सुनी-सुनाई): एक वक्ता ने ग्राहक बैंक का उदाहरण दिया: "एक कर्मचारी ने निजी तौर पर लिए AI टूल में निजी जानकारी वाली फ़ाइल डालकर गुमनाम करवाई, 3 मिनट बाद सूचना सुरक्षा विभाग का फ़ोन आया, और रिपोर्ट व अनुशासनात्मक कार्रवाई हुई" (सारांश)।
Will 保哥 (व्याख्यान) · वीडियो 1:39:00 से - ख़तरा हार्नेस में है: उसी व्याख्यान में: "एजेंट में ख़तरा मॉडल नहीं, हार्नेस है (फ़ाइलें लिखने और नेटवर्क से बात करने वाला आसपास का ढाँचा)। मॉडल तो GPU के अंदर बस शब्द जोड़ता है" (सारांश)। चेकलिस्ट के पॉइंट 19 (सैंडबॉक्स) की वजह यही है।
Will 保哥 (व्याख्यान) · वीडियो 1:21:00 से - वर्ज़न तय करने की वजह: "क्वांटाइज़्ड वर्ज़न के नए रिवीज़न में MTP लेयर हटा दी गई, और स्पेक्युलेटिव डिकोडिंग चलनी बंद हो गई। इसलिए कमिट से तय करें" (सारांश)। स्टेप 1 में "वर्ज़न तय करना" इसी वजह से है।
RepoChad · वीडियो 4:05 से - पोर्ट 11434 पर कोई ताला नहीं: "Ollama की
localhost:11434API में डिफ़ॉल्ट रूप से ऑथेंटिकेशन नहीं है। सर्वर पर चलाएँ तो रिवर्स प्रॉक्सी या फ़ायरवॉल से नियंत्रित करें" (सारांश)।
जापानी व्याख्या वीडियो · वीडियो 10:00 से - पोर्ट 8000 दुनिया के लिए न खोलें: क्लाउड GPU पर आज़माने के उदाहरण में: "8000 पोर्ट दुनिया के लिए नहीं खोलना चाहते, इसलिए SSH पोर्ट फ़ॉरवर्डिंग से जुड़ते हैं" (सारांश)। TLS तैयार होने से पहले, टेस्ट के दौर का विकल्प।
The Cef Experience · वीडियो 9:31 से - ऑन-प्रेम में भी ज़रूरत से ज़्यादा दिखता है: "अनुमतियों का डिज़ाइन छोड़ दिया, तो AI वेतन और HR जैसी जानकारी भी बता देगा जो दिखनी नहीं चाहिए। सिर्फ़ अंदर रख देने से सुरक्षित नहीं होता" (सारांश)।
जापानी व्याख्या वीडियो · वीडियो 24:30 से - अपडेट का रिकॉर्ड एक पंक्ति में: "मौजूदा वर्ज़न तय करके टैग रखें, और किसने कब अपडेट किया, कब वापस किया, एक पंक्ति में लिखें। गड़बड़ी के समय काम आता है" (सारांश)। स्टेप 9 के रिकॉर्ड का रूप यही है।
जापानी व्याख्या वीडियो · वीडियो 7:01 से - समय भी लागत है: Ollama और टनल से 2 दिन आज़माकर वापस क्लाउड पर लौटने के अनुभव से: "मुफ़्त में छुपी लागत होती है। समय भी लागत है" (सारांश)।
Garfield_Investment · वीडियो 8:02 से
कुछ वीडियो अनौपचारिक बदले हुए मॉडल से व्यावसायिक सॉफ़्टवेयर का ऑथेंटिकेशन तोड़ने का प्रदर्शन भी करते हैं; उनकी नक़ल न करें। अनजान स्रोत के बदले हुए वर्ज़न इस पेज के स्टेप में इस्तेमाल नहीं होते।
18 वीडियो से कुल मिलाकर दिखने वाली बातें
- गोपनीयता दायित्व: एक टैक्स सलाहकार ने 1 Mac, Ollama, Qwen3 और Open WebUI से ऐसा टैक्स AI बनाया जो Wi-Fi बंद करने पर भी चलता है। कई चरणों वाली टैक्स गणना मुश्किल है, और फ़िलहाल ग्राहक की सहमति से क्लाउड इस्तेमाल करना सबसे अच्छा है, ऐसा भी कहा।
- एयर गैप: टूल मिरर करना, मॉडल को भौतिक रूप से अंदर लाना, और बंद नेटवर्क के स्टोरेज से इन्फ़रेंस इंजन चालू करना, ये 4 चरण। साथ में मूल्यांकन और गेटवे भी।
- इंजन का बँटवारा: अकेले के लिए llama.cpp, बहुत लोगों के लिए vLLM, एक ही लंबा निर्देश दोहराने वाले एजेंट के लिए SGLang। प्रोडक्शन में Windows के बजाय Linux, ऐसी राय भी है।
- 2 GPU मिलकर 1 बड़ा GPU नहीं बनते: कार्डों के बीच का संचार रुकावट बनता है, और एक व्यक्ति के लिए रफ़्तार ज़्यादा नहीं बदलती। बढ़ता है तो एक साथ के कनेक्शन और कॉन्टेक्स्ट की लंबाई, ऐसी व्याख्या कई जगह थी।
- लंबे कॉन्टेक्स्ट में इंतज़ार: 16GB के 2 GPU पर Qwen3.8-27B चलाने के उदाहरण में, लगभग 2.5 लाख टोकन के इनपुट पर पहले अक्षर तक 4 मिनट से ज़्यादा लगे।
कथन, ऑडियो की ऑटोमैटिक ट्रांसक्रिप्ट से बनाया गया सारांश हैं, शब्दशः उद्धरण नहीं। समय अंदाज़न है; कभी-कभी बात लिंक के समय से 30 सेकंड बाद आती है। आँकड़े हर सेटअप का सिर्फ़ एक उदाहरण हैं।
SIMY से संबंध: बंद नेटवर्क के अंदर Qwen, बाहर SIMY
साफ़-साफ़ बताते हैं। SIMY फ़िलहाल Qwen पर नहीं चलता, और बंद नेटवर्क के अंदर या ऑफ़लाइन भी नहीं चलता।
- ट्रांसक्रिप्टगोपनीय मीटिंग
- सारांशकंपनी के GPU पर
- ड्राफ़्टटेक्स्ट बाहर नहीं जाता
- अनुमति वाला दायराज़िम्मेदार, डेडलाइन, शेड्यूल
- ज़िम्मेदार और डेडलाइनमीटिंग से उठाता है
- रिप्लाईGmail में ड्राफ़्ट तक
- फ़ैसलासिर्फ़ 1 सवाल लौटता है
* बँटवारा केवल समझाने के लिए एक उदाहरण है
- मीटिंग और चैट से उठाता है
- आपके तरीक़े से
- सिर्फ़ फ़ैसला लौटाता है
गोपनीय टेक्स्ट, बंद नेटवर्क के Qwen पर संभालें। उसके बाद "कौन, कब तक, क्या करेगा" में से जितना कंपनी ने बाहर देने की अनुमति दी है, उतना SIMY कंपनी के अनुमति वाले टूल में आगे बढ़ाता है।
- SIMY कैसे चलता है: क्लाउड पर काम आपके ChatGPT अकाउंट (Codex) से चलता है। Codex का इस्तेमाल आपके ChatGPT प्लान के दायरे में होता है।
- PC पर चलाना: SIMY डेस्कटॉप ऐप, PC पर मौजूद Claude Code को काम करने वाले के रूप में इस्तेमाल कर सकता है। यहाँ से डाउनलोड करें।
- बातचीत का इतिहास पढ़ना: डेस्कटॉप ऐप Claude Code और Codex की बातचीत का इतिहास पढ़ता है, और बार-बार होने वाले काम को "SIMY का सुझाव" बनाता है। बातचीत का टेक्स्ट सर्वर पर सेव नहीं होता। कौन-से PC और कितना दायरा, यह कंपनी के नियमों से तय करें।
रेखा कहाँ खींचें: कौन-सी जानकारी बंद नेटवर्क में रहे और कहाँ से बाहरी टूल में संभाली जा सकती है, यह कंपनी के नियम तय करते हैं। SIMY डेटा कैसे संभालता है, यह सुरक्षा और गोपनीयता नीति में सार्वजनिक है।
लोकल LLM और Qwen: अक्सर पूछे जाने वाले सवाल
लोकल LLM क्या है?
सार्वजनिक रूप से जारी मॉडल के वेट्स को अपने PC या कंपनी के सर्वर पर चलाने का तरीक़ा। डाला गया टेक्स्ट उस मशीन से बाहर नहीं जाता, इसलिए गोपनीय दस्तावेज़ भी संभाले जा सकते हैं।
लोकल LLM से क्या-क्या कर सकते हैं?
गोपनीय दस्तावेज़ों का सारांश और ड्राफ़्ट, अंदरूनी दस्तावेज़ पढ़ाकर सवालों के जवाब (RAG), अनुवाद और कोड में मदद। छोटे मॉडल अंतिम वर्ज़न से ज़्यादा "पहला ड्राफ़्ट" बनाने के लिए ठीक हैं।
कौन-सा लोकल LLM अच्छा रहेगा?
पहली बार आज़माने के लिए Qwen3 का 4B से 8B, विभाग में इस्तेमाल के लिए Qwen3-14B, 32B या Qwen3.8-27B, और कोड के लिए Qwen3-Coder (अक्टूबर 2026 तक)। बड़ा GPU ख़रीदने से पहले, अपने मौजूदा PC पर देखें कि "पहले ड्राफ़्ट" के लिए काम चलता है या नहीं।
क्या लोकल पर Qwen मुफ़्त है?
Apache 2.0 वाले मॉडल में कोई उपयोग शुल्क नहीं, और व्यावसायिक उपयोग भी कर सकते हैं। लेकिन GPU, सर्वर, बिजली और संचालन का ख़र्च कंपनी का अपना है, और कुछ मॉडल का अपना अलग लाइसेंस है।
Qwen को लोकल पर चलाने के लिए कितना स्पेक चाहिए?
Qwen के आधिकारिक आँकड़ों के अनुसार, Qwen3-8B को BF16 में लगभग 16GB और Qwen3-32B को FP8 में लगभग 33GB GPU मेमोरी चाहिए। ये मुख्य रूप से वेट्स के आँकड़े हैं; एक साथ इस्तेमाल करने वालों और कॉन्टेक्स्ट की लंबाई के अनुपात में KV कैश का हिस्सा बढ़ता है।
क्या Qwen3.8-27B एक RTX 5090 पर चलता है?
4bit क्वांटाइज़्ड वर्ज़न 32GB के एक RTX 5090 में समा जाता है। BF16 में सिर्फ़ वेट्स लगभग 54GB (गणना से अंदाज़ा) हैं, इसलिए नहीं समाता; FP8 वर्ज़न के भी सिर्फ़ वेट्स लगभग 29GB हैं, इसलिए कॉन्टेक्स्ट की सीमा काफ़ी घटाए बिना नहीं समाता।
Ollama और vLLM में क्या फ़र्क़ है?
Ollama आसानी से आज़माने के लिए है, और vLLM बहुत से लोगों के एक साथ प्रोडक्शन इस्तेमाल के लिए। Ollama डिफ़ॉल्ट रूप से सिर्फ़ 127.0.0.1 पर सुनता है, लेकिन vLLM में --host छोड़ दें तो वह सभी इंटरफ़ेस पर सुनता है, इसलिए इसे हमेशा लिखें।
क्या बंद नेटवर्क में भी अपडेट ज़रूरी है?
हाँ। vLLM लगभग हर 2 हफ़्ते में रिलीज़ होता है, और लगभग हर बार सुरक्षा सुधार आते हैं। लाने वाले टर्मिनल पर डाउनलोड करें, टेस्ट एनवायरनमेंट में तुलना करें और फिर प्रोडक्शन में डालें, यह क्रम पहले से तय रखें।
क्या Qwen का व्यावसायिक उपयोग कर सकते हैं?
Apache 2.0 वाले मॉडल (Qwen3, Qwen3.8-27B आदि) का व्यावसायिक उपयोग कर सकते हैं। Qwen2.5-3B, 72B और Qwen3.8-Flash-Next जैसे मॉडल अलग लाइसेंस पर हैं, इसलिए जिस मॉडल का इस्तेमाल करेंगे उसकी LICENSE लीगल के साथ जाँच लें।
क्या Qwen हिन्दी और दूसरी भाषाएँ समझता है?
Qwen3 पीढ़ी की घोषणा में 119 भाषाओं और बोलियों के समर्थन का दावा है। छोटे मॉडल लंबे टेक्स्ट में अटपटी भाषा लिख सकते हैं, इसलिए ज़रूरी लिखावट जाँचकर इस्तेमाल करें।
क्या Qwen Mac पर चलता है?
हाँ। Ollama, LM Studio और llama.cpp, Mac पर चलते हैं। Apple silicon मेमोरी को GPU के साथ साझा करता है, इसलिए मॉडल फ़ाइल से काफ़ी ज़्यादा मेमोरी चाहिए।
क्या ऑन-प्रेम होना ही सुरक्षित होना है?
सिर्फ़ इतने से सुरक्षित नहीं कहा जा सकता। सुनने की जगह, ऑथेंटिकेशन, बाहर का ट्रैफ़िक, लॉग और अंदरूनी दस्तावेज़ों के देखने के अधिकार तय करने के बाद ही आप समझा सकते हैं कि डेटा बाहर नहीं जाता।
क्या SIMY बंद नेटवर्क में इस्तेमाल हो सकता है?
नहीं। फ़िलहाल SIMY बंद नेटवर्क के अंदर या ऑफ़लाइन नहीं चलता, और Qwen पर भी नहीं चलता। गोपनीय टेक्स्ट बंद नेटवर्क के Qwen पर संभालें, और कंपनी की अनुमति वाले दायरे का आगे का काम SIMY से बढ़ाएँ, ऐसा बँटवारा किया जा सकता है।
संदर्भ
स्टेप, डिफ़ॉल्ट सेटिंग और लाइसेंस, नीचे दी गई आधिकारिक जानकारी से जाँचे गए (जाँच की तारीख़: 1 अक्टूबर 2026)। वर्ज़न और डिफ़ॉल्ट मान अक्सर बदलते हैं, इसलिए सेटअप से पहले हर आधिकारिक पेज देख लें।
- Security (vLLM डॉक्यूमेंटेशन), Usage Stats Collection, vllm serve
- vLLM रिलीज़ नोट्स (GitHub)
- Server Arguments (SGLang डॉक्यूमेंटेशन)
- FAQ (Ollama डॉक्यूमेंटेशन)
- llama.cpp server README (GitHub)
- vLLM से डिप्लॉयमेंट (Qwen डॉक्यूमेंटेशन), Speed Benchmark (Qwen डॉक्यूमेंटेशन)
- Qwen (Hugging Face), Qwen3.8-27B मॉडल कार्ड
- Hugging Face CLI, एनवायरनमेंट वेरिएबल (Hugging Face Hub)
- ngx_http_auth_request_module (nginx डॉक्यूमेंटेशन), ngx_http_ssl_module
- Environment Variable Configuration (Open WebUI डॉक्यूमेंटेशन)
- Packet filtering and firewalls (Docker डॉक्यूमेंटेशन)
- qwen3.8 (Ollama लाइब्रेरी)