Sommaire
Du confidentiel impossible à confier à une IA externe ?
L'IA irait plus vite, vous le savez. Mais cette conversation ne peut pas sortir de l'entreprise.
Anonymisé avec une IA perso : la sécurité informatique appelle. Un rapport à rédiger.
« Pas d'IA externe », a tranché le juridique. L'intérêt est clair, mais rien n'avance.
Testé avec Ollama. Mais qui peut s'y connecter ? Impossible à dire.
Ça ne peut pas sortir, donc pas d'IA. Entre les deux, il existe une voie : la faire tourner sur vos propres serveurs.
* Les cas 1 et 2 s'inspirent d'exemples cités dans des vidéos explicatives (Ce que disent les vidéos).
Ce que vous vouliez vraiment : le confidentiel, avec un Qwen interne
Mêmes documents, mêmes réunions. L'IA s'en charge, et les données restent dans l'entreprise.
Les données restent sur vos serveurs. Rien à coller dans une IA externe.
Écoute, authentification, sortant, logs : vous montrez où tout est bloqué.
Récupérer, tester, registre, prod. Le même circuit, quel que soit l'opérateur.
« On passe à cette version ? » La comparaison est prête : une seule question.
Tout cela se met en place avec les étapes et la checklist de cette page. Pour la répartition qui inclut la suite des réunions, voir Et SIMY ?
LLM local : pourquoi faire tourner Qwen en interne
Un LLM local, c'est faire tourner les poids publiés d'un modèle sur votre PC ou sur les serveurs de l'entreprise. Le texte saisi ne quitte pas la machine.
| Nom | Où il tourne | Pour quels usages |
|---|---|---|
| LLM local | Votre PC (Mac ou Windows) | Tester seul, travailler hors ligne |
| LLM sur site, LLM interne | Serveurs ou datacenter de l'entreprise | Usage simultané par un service ou toute l'entreprise |
| LLM en réseau isolé | Un réseau sans accès à Internet | Secret professionnel, données personnelles, données techniques |
Ce qu'un LLM local permet
- Résumer et rédiger des documents confidentiels : comptes rendus, contrats, dossiers de conception, échanges clients.
- Interroger les documents internes (RAG) : lui faire lire règlements et procédures, puis lui poser des questions.
- Traduction et aide au code : traduction chinois, anglais, français ; explication et propositions de correction du code interne.
Un petit modèle n'est pas aussi performant qu'un grand modèle dans le cloud. Utilisez-le pour produire un premier jet plutôt qu'une version finale : l'écart avec vos attentes sera moindre.
Pourquoi Qwen
- Des modèles sous Apache 2.0
- Multilingue, dont le français
- Plusieurs tailles au choix
- Licence : de nombreux modèles, comme Qwen3 ou Qwen3.8-27B, sont publiés sous Apache 2.0. Mais pas tous (tableau ci-dessous).
- Langues : l'annonce de la génération Qwen3 revendique 119 langues et dialectes, dont le français.
- Taille : de 0,6B à 8B pour un PC, de 27B à 32B qui tiennent sur un seul GPU une fois quantifiés, jusqu'à 235B qui demande plusieurs GPU.
La licence dépend du modèle
Faites défiler le tableau horizontalement →
| Modèle | Licence | Niveau de vérification |
|---|---|---|
| Qwen3 (0.6B à 32B, 30B-A3B, 235B-A22B-2507), Qwen3-VL, Qwen3-Coder, Qwen3-Embedding et Reranker | Apache 2.0 | Vérifié sur Hugging Face |
| Qwen3.5 (0.8B à 35B-A3B), Qwen3.6 (27B, 35B-A3B), Qwen3.8-27B (y compris la version FP8) | Apache 2.0 | Vérifié sur Hugging Face |
| La plupart des Qwen2.5 (0.5B à 32B, Coder 7B et 14B, VL-7B) | Apache 2.0 | Vérifié sur Hugging Face |
| Qwen2.5-3B, Qwen2.5-VL-3B | qwen-research (recherche ; l'usage commercial relève d'un autre régime) | Nom seulement. Texte à vérifier |
| Qwen2.5-72B-Instruct, Qwen2.5-VL-72B | qwen (licence propre) | Nom seulement. Conditions à vérifier |
| Qwen3.8-2.4T-A95B | Licence propre | Vérifié sur Hugging Face |
| Qwen3.8-Flash-Next | qwen-community-1.0. Une licence distincte serait requise pour une offre MaaS ou un usage « AI work assistant » (aide au code, bureautique, etc.) | Vérifié via un résumé. Avis juridique indispensable |
Vérifié le 1er octobre 2026 dans les fiches des modèles de l'organisation Qwen sur Hugging Face. « Qwen, donc Apache 2.0 » est faux. Avant tout usage commercial, vérifiez avec votre service juridique le fichier LICENSE du dépôt du modèle utilisé.
LLM local recommandé : quel Qwen pour quel usageoctobre 2026. Dans le doute, commencez petit
- Tester d'abord sur un PC : Qwen3 de 4B à 8B, ou les petits Qwen3.5. Ils tournent avec Ollama ou LM Studio et permettent de voir s'ils servent au travail.
- Résumés et brouillons pour un service : Qwen3-14B ou 32B, ou Qwen3.8-27B. En FP8 ou en 4 bits, ils tiennent sur un seul GPU ; seul le 3.8-27B gère aussi les images.
- Aide au code : Qwen3-Coder (30B-A3B). Un MoE avec peu de paramètres actifs, rapide pour sa taille.
- Recherche dans les documents internes : en plus du modèle qui répond, combinez Qwen3-Embedding et Reranker.
Fixez d'abord un usage précis avant de tester : il devient plus facile de juger quelle taille suffit. Avant d'acheter un gros GPU, vérifiez sur votre PC actuel si le modèle fait l'affaire pour un premier jet : c'est le plus court chemin.
L'utilisation de Qwen lui-même (Qwen Chat, API, principaux modèles) est détaillée dans le guide Qwen, et la comparaison avec les autres modèles chinois dans le comparatif des IA chinoises (LLM).
Choisir un moteur d'inférence : Ollama, llama.cpp, vLLM, SGLang, LM Studio
Le logiciel qui fait tourner le modèle s'appelle un « moteur d'inférence ». Côté sécurité, la grande différence, c'est l'adresse d'écoute par défaut.
Faites défiler le tableau horizontalement →
| Moteur | Écoute par défaut | Authentification native | TLS | Trafic sortant | Usage conseillé |
|---|---|---|---|---|---|
| Ollama | 127.0.0.1:11434 | Non mentionnée dans la FAQ officielle. Via un proxy | Non. Terminée au proxy | Fonctions cloud coupées par OLLAMA_NO_CLOUD=1. Les versions Mac et Windows vont chercher les mises à jour automatiquement | Essais individuels ou en petite équipe, Mac |
| llama.cpp (llama-server) | 127.0.0.1:8080 | --api-key, --api-key-file | --ssl-key-file, --ssl-cert-file | --offline coupe les vérifications réseau | Usage individuel, GGUF, CPU, Apple, AMD |
| vLLM | Sans --host, toutes les interfaces (port 8000) | --api-key ou VLLM_API_KEY. Ne protège qu'une partie, comme /v1 | --ssl-keyfile, --ssl-certfile | Envoie des statistiques d'usage par défaut. Coupées par VLLM_NO_USAGE_STATS=1 | Production à forte concurrence, service ou entreprise |
| SGLang | 127.0.0.1:30000 | --api-key. Pour l'admin, --admin-api-key | Plus sûr de terminer au proxy | Téléchargement des modèles coupé par HF_HUB_OFFLINE=1 | Agents, réutilisation d'un même long prompt |
| LM Studio | Votre PC seulement (port 1234). Ouverture au réseau local dans les réglages | Voir la doc officielle | Non | Voir la doc officielle | Tester avec une interface, Mac ou PC personnel |
Vérifié dans la documentation officielle de chaque outil (et le code source pour vLLM), octobre 2026. Pour LM Studio, les points non confirmés sont marqués « Voir la doc officielle ».
- Pour valider d'abord : llama.cpp ou Ollama, pour voir si cela sert au travail.
- Pour toute l'entreprise : vLLM. La vitesse tient même avec beaucoup d'utilisateurs simultanés.
- Des agents qui envoient en masse les mêmes longues consignes : SGLang.
Attention avec vLLM : la page Security officielle explique que --api-key ne protège que /v1 et quelques autres chemins, pas /invocations ni /pooling, par exemple. C'est pourquoi la documentation elle-même présente comme mesure la plus efficace un reverse proxy qui ne laisse passer que les endpoints à exposer.
Matériel : mémoire GPU nécessaire selon le modèle Qwen
La mémoire GPU nécessaire se calcule comme une somme de trois termes.
- Poidsnombre de paramètres × octets par paramètre (BF16 : 2, FP8 : 1, 4 bits : env. 0,5)
- + Cache KVproportionnel à la longueur du contexte × nombre d'utilisateurs simultanés
- + Margeespace de travail à l'exécution
Faites défiler le tableau horizontalement →
| Modèle | BF16 | FP8 | 4 bits (INT4, etc.) | Source |
|---|---|---|---|---|
| Qwen3-8B | env. 16 Go | env. 9,3 Go | env. 6,2 Go | Benchmark de vitesse officiel de Qwen |
| Qwen3-14B | env. 28 Go | env. 16 Go | env. 10 Go | Idem |
| Qwen3-32B | env. 63 Go | env. 33 Go | env. 19 Go | Idem |
| Qwen3-235B-A22B | 8 GPU | 4 GPU | 4 GPU (GPTQ-INT4) | Idem (configuration SGLang) |
| Qwen3.8-27B | env. 54 Go (poids seuls, estimation calculée) | env. 27 Go (calculé). Une mesure donne env. 28,8 Go pour la version FP8 officielle | env. 14 Go (calculé). Fichiers réels autour de 17 à 18 Go (téléchargement Ollama : env. 18 Go) | Calcul à partir du nombre de paramètres, mesure individuelle, bibliothèque Ollama |
Pour Qwen3, valeurs du benchmark de vitesse officiel de Qwen (mémoire GPU juste après le démarrage, entrée courte traitée avec transformers). Pour Qwen3.8-27B, faute de tableau officiel, estimation calculée à partir du nombre de paramètres et mesure individuelle, cache KV non compris. Le besoin varie fortement selon la quantification et la longueur du contexte (octobre 2026).
- Qwen3.8-27B et un GPU de 32 Go : en BF16, les poids seuls font environ 54 Go (estimation calculée) : impossible sur une seule RTX 5090 (32 Go). La version FP8 officielle pèse elle aussi environ 28,8 Go de poids, et une estimation publiée montre qu'avec le contexte maximal, 32 Go ne suffisent pas. On ajuste en passant en 4 bits ou en réduisant le contexte maximal.
- Deux GPU de 16 Go ne valent pas un GPU de 32 Go : répartir sur deux cartes coûte la communication entre elles et l'espace de travail propre à chacune.
- Un long contexte allonge l'attente : dans une mesure individuelle, avec environ 250 000 tokens en entrée, le premier caractère a mis plus de 4 minutes à sortir.
- Mac : Apple Silicon partage la mémoire avec le GPU. Il faut nettement plus de mémoire que la taille du fichier du modèle.
Pour dimensionner : fixez d'abord le nombre d'utilisateurs simultanés et la longueur des documents lus en une fois. Le cache KV croît avec ces deux valeurs : si vous ne comptez que les poids, la mémoire manquera en production.
Installer sur un réseau isolé : Qwen et vLLM sur un serveur interne
Exemple avec Qwen3.8-27B en FP8, vLLM (Docker) et un serveur Linux. Les commandes suivent la documentation officielle d'octobre 2026. Si la mémoire GPU manque, réduisez le contexte maximal (--max-model-len) ou choisissez une version 4 bits.
* Architecture fictive, à titre d'illustration
Lire les commandes : remplacez les parties entre chevrons, comme <SHA-du-commit-vérifié>, par vos propres valeurs. Les numéros de version sont des exemples d'octobre 2026.
-
Récupérer le modèle à une version figée
Poste de transfert (côté Internet)Téléchargez depuis les dépôts de l'organisation officielle
Qwen/, en précisant le commit. Enregistrez aussi le conteneur du moteur d'inférence à une version figée.bashpip install -U huggingface_hub hf download Qwen/Qwen3.8-27B-FP8 \ --revision <SHA-du-commit-vérifié> \ --local-dir ./Qwen3.8-27B-FP8 docker pull vllm/vllm-openai:v0.30.0 docker inspect --format '{{index .RepoDigests 0}}' vllm/vllm-openai:v0.30.0 docker save vllm/vllm-openai:v0.30.0 -o vllm-openai-v0.30.0.tarReportez dans le registre le digest affiché par
docker inspect(la valeur qui commence parsha256:).Pourquoi figer la version : un même dépôt peut changer de contenu d'une révision à l'autre. Pour une version quantifiée, on rapporte qu'une nouvelle révision a supprimé la couche de décodage spéculatif (MTP), et que l'accélération ne se déclenchait plus.
-
Créer le registre SHA-256
Poste de transfertLe
lfs.oidrenvoyé par l'API Hugging Face est le SHA-256 des gros fichiers (LFS). Comparez-le à vos fichiers locaux.bash# Extraire les valeurs côté Hugging Face (fichiers LFS uniquement) curl -s "https://huggingface.co/api/models/Qwen/Qwen3.8-27B-FP8/tree/<SHA-du-commit-vérifié>?recursive=true&expand=true" \ | jq -r '.[] | select(.lfs) | "\(.lfs.oid) ./\(.path)"' > HF.sha256 # Comparer aux fichiers locaux et créer le registre de tous les fichiers cd Qwen3.8-27B-FP8 sha256sum -c ../HF.sha256 find . -type f ! -path './.cache/*' -print0 | sort -z | xargs -0 sha256sum > ../MODEL.sha256 cd .. && sha256sum vllm-openai-v0.30.0.tar > IMAGE.sha256Une autre personne que celle qui a téléchargé signe le registre pour validation (selon la méthode de signature de votre entreprise).
-
Transférer sur support, vérifier avant de charger
Serveur du réseau isoléTransférez le registre et les fichiers sur support, puis refaites la vérification côté isolé. Une seule ligne
FAILED, et on n'utilise pas.bashcd /srv/llm/models/Qwen3.8-27B-FP8 && sha256sum -c /srv/llm/incoming/MODEL.sha256 cd /srv/llm/incoming && sha256sum -c IMAGE.sha256 docker load -i vllm-openai-v0.30.0.tar -
Démarrer en écoute sur 127.0.0.1 uniquement
Serveur du réseau isoléSans
--host, vLLM écoute sur toutes les interfaces. Écrivez toujours--host 127.0.0.1et passez la clé par un fichier (en ligne de commande, elle est visible avecps).bash · vLLM (Docker)# Créer le fichier de clé avec les droits 600 sudo install -D -m 600 /dev/null /etc/llm/vllm.env echo "VLLM_API_KEY=$(openssl rand -hex 32)" | sudo tee /etc/llm/vllm.env > /dev/null sudo docker run -d --name qwen --gpus all --ipc=host --network host \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 \ --served-model-name qwen3.8-27b \ --host 127.0.0.1 --port 8000 \ --max-model-len 65536 --gpu-memory-utilization 0.90 # Vérifier l'écoute sur 127.0.0.1:8000 uniquement ss -ltnp | grep 8000- Pas de
--trust-remote-code. Pour ne pas exécuter le code livré avec le modèle. - Pas de
VLLM_SERVER_DEV_MODE=1en production. Il expose des endpoints de développement. - Mode réflexion et appels d'outils : la documentation officielle de Qwen cite, pour Qwen3,
--reasoning-parser qwen3et--enable-auto-tool-choice --tool-call-parser hermes. Pour la génération 3.8, vérifiez dans la fiche du modèle.
bash · avec Ollama (systemd)sudo systemctl edit ollama # Écrire ces 3 lignes dans le fichier ouvert, puis enregistrer [Service] Environment="OLLAMA_HOST=127.0.0.1:11434" Environment="OLLAMA_NO_CLOUD=1" sudo systemctl restart ollamabash · avec SGLang ou llama.cpppython3 -m sglang.launch_server --model-path /models/Qwen3.8-27B-FP8 \ --host 127.0.0.1 --port 30000 --api-key <clé> --admin-api-key <clé-admin> llama-server -m /models/qwen.gguf --host 127.0.0.1 --port 8080 \ --api-key-file /etc/llm/keys --offline --no-webui --jinjaDans l'exemple SGLang aussi, n'écrivez pas la clé en clair : passez-la en pratique par un fichier ou une variable d'environnement. Les exemples des fiches de modèles utilisent
--host 0.0.0.0: ne les copiez pas tels quels. - Pas de
-
TLS, liste d'autorisation et authentification avec nginx
Serveur du réseau isolé (passerelle)Les utilisateurs n'ont accès qu'à nginx. Seules les routes nécessaires de
/v1passent ; tout le reste renvoie 404.nginxserver { listen 443 ssl; server_name llm.internal.example; ssl_certificate /etc/pki/llm.crt; ssl_certificate_key /etc/pki/llm.key; ssl_protocols TLSv1.2 TLSv1.3; allow 10.20.0.0/16; # segment interne uniquement deny all; location = /v1/chat/completions { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <clé-amont>"; proxy_pass http://127.0.0.1:8000; proxy_buffering off; # pour les réponses en streaming } location = /v1/models { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <clé-amont>"; proxy_pass http://127.0.0.1:8000; } location = /_auth { internal; proxy_pass http://127.0.0.1:4180/oauth2/auth; # lien avec l'IdP interne via oauth2-proxy, par ex. } location / { return 404; } # ne pas exposer /metrics, /invocations, etc. }Les utilisateurs s'identifient par le SSO interne (OIDC ou SAML), et la clé d'API amont ne leur est jamais distribuée.
auth_requestest un module nginx :nginx -Vindique s'il est inclus dans votre build. -
Bloquer le trafic sortant
Serveur du réseau isoléPar défaut, refusez toute connexion du serveur vers Internet. N'autorisez que le DNS interne, la synchronisation de l'heure et le collecteur de logs.
bash · ufwsudo ufw default deny incoming sudo ufw default deny outgoing sudo ufw allow in on <interface-admin> to any port 22 proto tcp # à autoriser d'abord, sinon SSH coupe sudo ufw allow in on <interface-interne> to any port 443 proto tcp sudo ufw allow out to <DNS-interne> port 53 proto udp sudo ufw allow out to <NTP-interne> port 123 proto udp sudo ufw allow out to <collecteur-logs> port 514 proto tcp sudo ufw enable # Vérifier qu'on ne peut pas sortir (l'échec est le bon résultat) curl -m 5 https://huggingface.coSi vous publiez un port avec
-pdans Docker, Docker ajoute ses propres règles de filtrage : le port peut rester joignable de l'extérieur même si ufw semble le fermer. Ces étapes utilisent--network hostet--host 127.0.0.1pour limiter l'écoute à la machine locale.bash · avec -p# Publier côté hôte sur 127.0.0.1 uniquement (-p 8000:8000 publie sur toutes les interfaces) sudo docker run -d --name qwen --gpus all --ipc=host \ -p 127.0.0.1:8000:8000 \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 --served-model-name qwen3.8-27b \ --host 0.0.0.0 --port 8000 --max-model-len 65536 # ↑ écoute sur 0.0.0.0 dans le conteneur, mais exposé sur 127.0.0.1 seulement côté hôteDans cette configuration, vLLM écoute sur
0.0.0.0à l'intérieur du conteneur, mais reste injoignable depuis l'extérieur de l'hôte. Bloquez aussi le trafic sortant au niveau du pare-feu réseau. -
Conserver logs et traces d'audit
Passerelle, supervisionQui, quand, quel endpoint : consignez-le dans les logs nginx et envoyez-les vers la plateforme de logs interne (SIEM, etc.). Comptez les tokens via
/metrics(format Prometheus), exposé uniquement sur le réseau de supervision.nginx · dans http { }log_format llm '$time_iso8601 user=$user ip=$remote_addr "$request" ' 'status=$status bytes=$body_bytes_sent rt=$request_time'; access_log /var/log/nginx/llm.log llm;Si vous activez
--enable-log-requestsdans vLLM au niveau DEBUG, le texte des prompts apparaît dans les logs. Conserver ou non ce texte, et combien de temps, se décide selon vos règles sur les données personnelles et la confidentialité. -
Définir utilisateurs et droits
Interface (Open WebUI, etc.)Pour un usage en chat, placez une interface comme Open WebUI dans le même réseau isolé, et répartissez les modèles accessibles par rôle et par groupe. Les départs sont bloqués via l'IdP interne.
env · Open WebUIOFFLINE_MODE=true ENABLE_SIGNUP=false DEFAULT_USER_ROLE=pending ENABLE_COMMUNITY_SHARING=falseAvec
OFFLINE_MODEactivé, la recherche documentaire (RAG) ne fonctionne pas si le modèle d'embedding n'a pas été installé au préalable. Apportez-le selon le même circuit que les étapes 1 à 3. -
Fixer le circuit de mise à jour
Poste de transfert → test → productionvLLM sort une version environ toutes les deux semaines, presque toujours avec des correctifs de sécurité. Même en réseau isolé, mettez à jour régulièrement selon le circuit « récupérer → tester → registre → production ».
bash# 1. Récupérer, vérifier et transférer la nouvelle version comme aux étapes 1 à 3 # 2. En environnement de test, poser les mêmes questions à l'ancienne et à la nouvelle version # 3. Lister les variables d'environnement utilisées et vérifier dans les notes de version qu'elles existent toujours sudo docker inspect --format '{{range .Config.Env}}{{println .}}{{end}}' qwen \ | grep -E '^(VLLM_|HF_)' | cut -d= -f1 # 4. Après la mise en production, noter en une ligne qui a mis à jour, quand, et quand on est revenu en arrière echo "$(date -I) vllm <ancienne>→<nouvelle> resp:<nom> test:OK retour:<ancienne>.tar" >> /srv/llm/CHANGELOGGardez le conteneur et le modèle de la version précédente, avec leur digest, pour pouvoir revenir en arrière. Comparez avant et après les valeurs qui changent d'une version à l'autre, comme la longueur maximale du contexte.
Checklist de sécurité d'un LLM local : 20 points avant la production
Avant et après l'installation, vérifiez dans l'ordre. Les cases ne servent que dans cette page : rien n'est envoyé.
0 / 20 vérifiés
Récupérer modèles et conteneurs
Écoute et trafic sortant
Point d'entrée et authentification
Droits, traces, exploitation
Erreurs fréquentes : les failles du « ça devrait aller »
À gauche, l'erreur fréquente ; à droite, la parade avec les étapes de cette page.
--host 0.0.0.0sans authentificationLa commande d'exemple, copiée telle quelle, ouvre le serveur à tout le réseau local.127.0.0.1+ nginxÉcoute locale seulement. Les utilisateurs passent par la passerelle.- Une version modifiée d'origine inconnueUn GGUF communautaire « Uncensored » utilisé sans vérifier sa provenance.Depuis
Qwen/officiel, SHA figéPour une version tierce, consigner l'auteur et la procédure. - « Il y a une api-key, donc c'est sûr »Croire que la clé de vLLM protège tous les endpoints.Filtrer par liste d'autorisationNe laisser passer que le nécessaire, comme
/v1/chat/completions. - « C'est sur site, donc c'est sûr »Faire l'impasse sur les droits, les logs et le contrôle d'accès du RAG parce que c'est interne.En interne, la même rigueurSSO, rôles, logs, recherche qui respecte les droits de lecture.
- Un tunnel pour l'utiliser de l'extérieurUn outil interne exposé sur Internet via Cloudflare Tunnel ou équivalent.Depuis le réseau interne seulementPour un accès externe, passer par l'accès distant officiel de l'entreprise.
- Ignorer le trafic sortant par défautStatistiques d'usage de vLLM, mises à jour automatiques d'Ollama desktop.Variables d'environnement et blocage sortantCouper dans la config, et aussi au pare-feu.
- Trop en demander à un petit modèleEn agent ou en appel d'outils, il invente des fichiers ou des liens.Un premier jet, pas plusExécution en bac à sable, résultats vérifiés par un humain.
- La mise à jour qui casseUne variable d'environnement disparue ou une limite changée, et plus rien ne tourne.Comparer avant/après en testCroiser avec les notes de version, noter qui a mis à jour.
Ce que disent les vidéos : Qwen auto-hébergé en pratique
Nous avons vérifié, jusqu'à la transcription audio, 18 vidéos explicatives en anglais, chinois et japonais publiées entre février et octobre 2026.
Ce que disent ces 18 vidéos8 scènes, et ce qui ressort de l'ensemble
D'après les propos : 8 scènes
- Ce qui s'est passé dans une banque (rapporté) : l'intervenant d'une conférence raconte le cas d'une banque cliente : un employé a fait anonymiser un fichier de données personnelles par un outil d'IA souscrit à titre personnel ; trois minutes plus tard, la sécurité informatique appelait, avec rapport et sanction à la clé (paraphrase).
Will 保哥 (conférence) · vidéo, à partir de 1:39:00 - Le danger, c'est le harnais : dans la même conférence : « avec un agent, le danger n'est pas le modèle mais le harnais (ce qui écrit des fichiers et communique autour). Le modèle ne fait qu'enchaîner des caractères dans le GPU » (paraphrase). C'est la raison du point 19 (bac à sable) de la checklist.
Will 保哥 (conférence) · vidéo, à partir de 1:21:00 - Pourquoi figer la version : « une nouvelle révision d'une version quantifiée a supprimé la couche MTP, et le décodage spéculatif ne se déclenchait plus. D'où le commit figé » (paraphrase). C'est la raison du « version figée » de l'étape 1.
RepoChad · vidéo, à partir de 4:05 - Le port 11434 n'a pas de clé : « l'API d'Ollama sur
localhost:11434n'a pas d'authentification par défaut. Sur un serveur, on la contrôle par reverse proxy ou pare-feu » (paraphrase).
Chaîne japonaise sur l'open source · vidéo, à partir de 10:00 - Ne pas ouvrir le 8000 au monde : en testant sur un GPU cloud : « je ne veux pas ouvrir le port 8000 au monde entier, donc je passe par une redirection de port SSH » (paraphrase). Une solution de phase de test, avant d'avoir le TLS.
The Cef Experience · vidéo, à partir de 9:31 - Sur site, mais trop visible : « si l'on néglige la gestion des droits, l'IA finit par répondre sur les salaires ou les RH, que personne ne devrait voir. L'installer en interne ne suffit pas à la sécuriser » (paraphrase).
Chaîne japonaise sur la gestion d'entreprise · vidéo, à partir de 24:30 - Une ligne pour tracer les mises à jour : « figer la version actuelle, garder le tag, et noter en une ligne qui a mis à jour quand, et quand on est revenu en arrière. Ça sauve en cas d'incident » (paraphrase). C'est la forme de trace de l'étape 9.
Chaîne japonaise d'actualité IA · vidéo, à partir de 7:01 - Le temps aussi coûte : après deux jours d'essais avec Ollama et un tunnel, retour au cloud : « le gratuit a des coûts cachés. Le temps aussi est un coût » (paraphrase).
Garfield_Investment · vidéo, à partir de 8:02
Certaines vidéos montrent comment contourner l'activation de logiciels commerciaux avec des modèles modifiés non officiels : ne les imitez pas. Les étapes de cette page n'utilisent aucune version modifiée d'origine inconnue.
Ce qui ressort des 18 vidéos
- Secret professionnel : un expert-comptable a monté une IA fiscale qui tourne Wi-Fi coupé, avec un seul Mac, Ollama, Qwen3 et Open WebUI. Il reconnaît que les calculs d'impôt en plusieurs étapes restent difficiles et que, pour l'instant, le cloud avec l'accord du client reste le meilleur choix.
- Air gap : quatre étapes : répliquer les outils, apporter physiquement le modèle, lancer le moteur d'inférence depuis le stockage interne au réseau isolé. Avec évaluation et passerelle en plus.
- Quel moteur pour qui : llama.cpp pour un utilisateur, vLLM pour beaucoup, SGLang pour des agents qui réutilisent les mêmes longues consignes. Certains défendent aussi Linux plutôt que Windows en production.
- Deux GPU ne font pas un grand GPU : la communication entre cartes devient le goulot, et la vitesse pour un seul utilisateur change peu. Ce qu'on gagne, ce sont les connexions simultanées et la longueur du contexte : plusieurs vidéos l'expliquent.
- L'attente des longs contextes : avec Qwen3.8-27B sur deux GPU de 16 Go, environ 250 000 tokens en entrée ont demandé plus de 4 minutes avant le premier caractère.
Les propos sont des paraphrases de transcriptions automatiques de l'audio, pas des citations mot pour mot. Les horodatages sont indicatifs : le passage peut venir une trentaine de secondes après le lien. Les chiffres valent pour la configuration de chaque vidéo.
Et SIMY ? Qwen dans le réseau isolé, SIMY à l'extérieur
Soyons francs : à ce jour, SIMY ne tourne pas sur Qwen, ni dans un réseau isolé, ni hors ligne.
- Transcriptionréunion confidentielle
- Résumésur le GPU interne
- Brouillonle texte ne sort pas
- Périmètre autoriséresponsables, échéances, agenda
- Qui et pour quandcaptés en réunion
- Réponsebrouillon dans Gmail
- Décisionune seule question
* Répartition fictive, à titre d'illustration
- Capté en réunion et en chat
- À votre façon
- Seulement les décisions
Le texte confidentiel reste traité par le Qwen isolé. Ensuite, pour « qui fait quoi, et pour quand », SIMY fait avancer la partie que l'entreprise a décidé de laisser sortir, dans des outils qu'elle autorise.
- Comment SIMY fonctionne : l'exécution dans le cloud passe par votre compte ChatGPT (Codex). L'usage de Codex s'inscrit dans votre offre ChatGPT.
- Exécution sur PC : l'application de bureau SIMY peut confier l'exécution à Claude Code sur votre PC. Télécharger l'application.
- Lecture de l'historique des conversations : l'application de bureau lit l'historique de Claude Code et de Codex et transforme le travail répétitif en « suggestions de SIMY ». Le texte des conversations n'est pas stocké sur nos serveurs. Les PC et le périmètre concernés se décident selon vos règles internes.
Où tracer la ligne : ce qui reste dans le réseau isolé et ce qui peut passer par des outils externes, ce sont les règles de l'entreprise qui le décident. Le traitement des données par SIMY est décrit dans les pages Sécurité et Politique de confidentialité.
LLM local et Qwen : questions fréquentes
Qu'est-ce qu'un LLM local ?
C'est faire tourner les poids publiés d'un modèle sur votre PC ou sur les serveurs de l'entreprise. Le texte saisi ne quitte pas la machine : on peut donc y traiter des documents confidentiels.
Que peut-on faire avec un LLM local ?
Résumer et rédiger des documents confidentiels, répondre à des questions sur les documents internes (RAG), traduire et aider au code. Un petit modèle convient mieux à un premier jet qu'à une version finale.
Quel LLM local choisir ?
Pour tester, Qwen3 de 4B à 8B ; pour un service, Qwen3-14B, 32B ou Qwen3.8-27B ; pour le code, Qwen3-Coder (octobre 2026). Avant d'acheter un gros GPU, vérifiez sur votre PC actuel s'il convient pour un premier jet.
Qwen est-il gratuit en local ?
Les modèles sous Apache 2.0 sont sans frais d'utilisation, y compris en usage commercial. Mais GPU, serveurs, électricité et exploitation sont à votre charge, et certains modèles ont une licence propre.
Quelle configuration pour faire tourner Qwen en local ?
Selon les chiffres officiels de Qwen, Qwen3-8B utilise environ 16 Go de mémoire GPU en BF16, et Qwen3-32B environ 33 Go en FP8. Ces valeurs portent surtout sur les poids : le cache KV s'y ajoute, proportionnel au nombre d'utilisateurs et à la longueur du contexte.
Qwen3.8-27B tourne-t-il sur une seule RTX 5090 ?
En version quantifiée 4 bits, oui, sur une RTX 5090 de 32 Go. En BF16, les poids seuls font environ 54 Go (estimation calculée) : impossible. La version FP8 pèse environ 29 Go de poids : elle ne tient qu'en réduisant fortement le contexte maximal.
Quelle différence entre Ollama et vLLM ?
Ollama sert à tester facilement ; vLLM est un moteur de production pour de nombreux utilisateurs simultanés. Ollama n'écoute par défaut que sur 127.0.0.1, alors que vLLM écoute sur toutes les interfaces sans --host : il faut toujours le préciser.
Faut-il mettre à jour même en réseau isolé ?
Oui. vLLM sort une version environ toutes les deux semaines, presque toujours avec des correctifs de sécurité. Fixez un circuit : récupérer sur le poste de transfert, comparer en test, puis passer en production.
Qwen est-il utilisable commercialement ?
Les modèles sous Apache 2.0 (Qwen3, Qwen3.8-27B, etc.) le sont. Qwen2.5-3B, 72B ou Qwen3.8-Flash-Next ont d'autres licences : vérifiez avec votre service juridique le fichier LICENSE du modèle utilisé.
Qwen comprend-il le français ?
Oui. L'annonce de la génération Qwen3 revendique 119 langues et dialectes, dont le français. Les petits modèles peuvent manquer de naturel sur de longs textes : relisez les textes importants avant de les utiliser.
Qwen tourne-t-il sur Mac ?
Oui. Ollama, LM Studio et llama.cpp fonctionnent sur Mac. Apple Silicon partage la mémoire avec le GPU : il faut nettement plus de mémoire que la taille du fichier du modèle.
Sur site, est-ce sûr ?
Pas à lui seul. C'est seulement après avoir défini l'adresse d'écoute, l'authentification, le trafic sortant, les logs et les droits de lecture sur les documents internes qu'on peut affirmer que rien ne sort.
SIMY fonctionne-t-il en réseau isolé ?
Non. À ce jour, SIMY ne tourne ni dans un réseau isolé, ni hors ligne, ni sur Qwen. On peut répartir ainsi : le texte confidentiel traité par le Qwen isolé, et la suite, dans le périmètre autorisé par l'entreprise, avancée par SIMY.
Sources
Étapes, réglages par défaut et licences ont été vérifiés dans les sources officielles suivantes (le 1er octobre 2026). Versions et valeurs par défaut changent souvent : consultez chaque page officielle avant l'installation.
- Security (documentation vLLM), Usage Stats Collection, vllm serve
- Notes de version de vLLM (GitHub)
- Server Arguments (documentation SGLang)
- FAQ (documentation Ollama)
- README de llama.cpp server (GitHub)
- Déploiement avec vLLM (documentation Qwen), Speed Benchmark (documentation Qwen)
- Qwen (Hugging Face), fiche du modèle Qwen3.8-27B
- Hugging Face CLI, Variables d'environnement (Hugging Face Hub)
- ngx_http_auth_request_module (documentation nginx), ngx_http_ssl_module
- Environment Variable Configuration (documentation Open WebUI)
- Packet filtering and firewalls (documentation Docker)
- qwen3.8 (bibliothèque Ollama)