1. SIMY
  2. Guides
  3. Qwen sur vos serveurs

Guide : LLM local et LLM interne

Le confidentiel reste chez vous, avec votre Qwen.

Données clients, échanges techniques : impossible de les coller dans une IA externe. Alors faites tourner Qwen sur vos propres serveurs, sans que rien ne sorte. Étapes et checklist, d'après la documentation officielle.

  • Des modèles sous Apache 2.0
  • Écoute sur 127.0.0.1, sortant bloqué
  • Checklist de 20 points incluse

* Architecture fictive, à titre d'illustration

Sommaire
  1. Ça vous parle ?
  2. Ce que vous vouliez vraiment
  3. LLM local : pourquoi Qwen
  4. Choisir un moteur d'inférence
  5. Matériel nécessaire
  6. Installer sur un réseau isolé
  7. Checklist de sécurité
  8. Erreurs fréquentes
  9. Ce que disent les vidéos
  10. Et SIMY ?
  11. Questions fréquentes
  12. Sources
01 / CAN'T SEND IT OUT

Du confidentiel impossible à confier à une IA externe ?

L'IA irait plus vite, vous le savez. Mais cette conversation ne peut pas sortir de l'entreprise.

Ex. : un fichier de données personnelles Trois minutes après, l'appel

Anonymisé avec une IA perso : la sécurité informatique appelle. Un rapport à rédiger.

Ex. : des documents avec données clients Projet gelé six mois

« Pas d'IA externe », a tranché le juridique. L'intérêt est clair, mais rien n'avance.

Revue de conception Ça marche, mais…

Testé avec Ollama. Mais qui peut s'y connecter ? Impossible à dire.

Ça ne peut pas sortir, donc pas d'IA. Entre les deux, il existe une voie : la faire tourner sur vos propres serveurs.

* Les cas 1 et 2 s'inspirent d'exemples cités dans des vidéos explicatives (Ce que disent les vidéos).

02 / WHAT YOU REALLY WANTED

Ce que vous vouliez vraiment : le confidentiel, avec un Qwen interne

Mêmes documents, mêmes réunions. L'IA s'en charge, et les données restent dans l'entreprise.

Toujours confidentiel Résumés et brouillons par l'IA

Les données restent sur vos serveurs. Rien à coller dans une IA externe.

Face à la DSI L'architecture en une page

Écoute, authentification, sortant, logs : vous montrez où tout est bloqué.

Lors des mises à jour Mettre à jour sans casser

Récupérer, tester, registre, prod. Le même circuit, quel que soit l'opérateur.

Ce qui vous revient Seulement la décision

« On passe à cette version ? » La comparaison est prête : une seule question.

Tout cela se met en place avec les étapes et la checklist de cette page. Pour la répartition qui inclut la suite des réunions, voir Et SIMY ?

03 / BASICS

LLM local : pourquoi faire tourner Qwen en interne

Un LLM local, c'est faire tourner les poids publiés d'un modèle sur votre PC ou sur les serveurs de l'entreprise. Le texte saisi ne quitte pas la machine.

NomOù il tournePour quels usages
LLM localVotre PC (Mac ou Windows)Tester seul, travailler hors ligne
LLM sur site, LLM interneServeurs ou datacenter de l'entrepriseUsage simultané par un service ou toute l'entreprise
LLM en réseau isoléUn réseau sans accès à InternetSecret professionnel, données personnelles, données techniques

Ce qu'un LLM local permet

  • Résumer et rédiger des documents confidentiels : comptes rendus, contrats, dossiers de conception, échanges clients.
  • Interroger les documents internes (RAG) : lui faire lire règlements et procédures, puis lui poser des questions.
  • Traduction et aide au code : traduction chinois, anglais, français ; explication et propositions de correction du code interne.

Un petit modèle n'est pas aussi performant qu'un grand modèle dans le cloud. Utilisez-le pour produire un premier jet plutôt qu'une version finale : l'écart avec vos attentes sera moindre.

Pourquoi Qwen

  • Des modèles sous Apache 2.0
  • Multilingue, dont le français
  • Plusieurs tailles au choix
  • Licence : de nombreux modèles, comme Qwen3 ou Qwen3.8-27B, sont publiés sous Apache 2.0. Mais pas tous (tableau ci-dessous).
  • Langues : l'annonce de la génération Qwen3 revendique 119 langues et dialectes, dont le français.
  • Taille : de 0,6B à 8B pour un PC, de 27B à 32B qui tiennent sur un seul GPU une fois quantifiés, jusqu'à 235B qui demande plusieurs GPU.

La licence dépend du modèle

Faites défiler le tableau horizontalement →

ModèleLicenceNiveau de vérification
Qwen3 (0.6B à 32B, 30B-A3B, 235B-A22B-2507), Qwen3-VL, Qwen3-Coder, Qwen3-Embedding et RerankerApache 2.0Vérifié sur Hugging Face
Qwen3.5 (0.8B à 35B-A3B), Qwen3.6 (27B, 35B-A3B), Qwen3.8-27B (y compris la version FP8)Apache 2.0Vérifié sur Hugging Face
La plupart des Qwen2.5 (0.5B à 32B, Coder 7B et 14B, VL-7B)Apache 2.0Vérifié sur Hugging Face
Qwen2.5-3B, Qwen2.5-VL-3Bqwen-research (recherche ; l'usage commercial relève d'un autre régime)Nom seulement. Texte à vérifier
Qwen2.5-72B-Instruct, Qwen2.5-VL-72Bqwen (licence propre)Nom seulement. Conditions à vérifier
Qwen3.8-2.4T-A95BLicence propreVérifié sur Hugging Face
Qwen3.8-Flash-Nextqwen-community-1.0. Une licence distincte serait requise pour une offre MaaS ou un usage « AI work assistant » (aide au code, bureautique, etc.)Vérifié via un résumé. Avis juridique indispensable

Vérifié le 1er octobre 2026 dans les fiches des modèles de l'organisation Qwen sur Hugging Face. « Qwen, donc Apache 2.0 » est faux. Avant tout usage commercial, vérifiez avec votre service juridique le fichier LICENSE du dépôt du modèle utilisé.

LLM local recommandé : quel Qwen pour quel usageoctobre 2026. Dans le doute, commencez petit
  • Tester d'abord sur un PC : Qwen3 de 4B à 8B, ou les petits Qwen3.5. Ils tournent avec Ollama ou LM Studio et permettent de voir s'ils servent au travail.
  • Résumés et brouillons pour un service : Qwen3-14B ou 32B, ou Qwen3.8-27B. En FP8 ou en 4 bits, ils tiennent sur un seul GPU ; seul le 3.8-27B gère aussi les images.
  • Aide au code : Qwen3-Coder (30B-A3B). Un MoE avec peu de paramètres actifs, rapide pour sa taille.
  • Recherche dans les documents internes : en plus du modèle qui répond, combinez Qwen3-Embedding et Reranker.

Fixez d'abord un usage précis avant de tester : il devient plus facile de juger quelle taille suffit. Avant d'acheter un gros GPU, vérifiez sur votre PC actuel si le modèle fait l'affaire pour un premier jet : c'est le plus court chemin.

L'utilisation de Qwen lui-même (Qwen Chat, API, principaux modèles) est détaillée dans le guide Qwen, et la comparaison avec les autres modèles chinois dans le comparatif des IA chinoises (LLM).

04 / ENGINES

Choisir un moteur d'inférence : Ollama, llama.cpp, vLLM, SGLang, LM Studio

Le logiciel qui fait tourner le modèle s'appelle un « moteur d'inférence ». Côté sécurité, la grande différence, c'est l'adresse d'écoute par défaut.

Faites défiler le tableau horizontalement →

MoteurÉcoute par défautAuthentification nativeTLSTrafic sortantUsage conseillé
Ollama127.0.0.1:11434Non mentionnée dans la FAQ officielle. Via un proxyNon. Terminée au proxyFonctions cloud coupées par OLLAMA_NO_CLOUD=1. Les versions Mac et Windows vont chercher les mises à jour automatiquementEssais individuels ou en petite équipe, Mac
llama.cpp (llama-server)127.0.0.1:8080--api-key, --api-key-file--ssl-key-file, --ssl-cert-file--offline coupe les vérifications réseauUsage individuel, GGUF, CPU, Apple, AMD
vLLMSans --host, toutes les interfaces (port 8000)--api-key ou VLLM_API_KEY. Ne protège qu'une partie, comme /v1--ssl-keyfile, --ssl-certfileEnvoie des statistiques d'usage par défaut. Coupées par VLLM_NO_USAGE_STATS=1Production à forte concurrence, service ou entreprise
SGLang127.0.0.1:30000--api-key. Pour l'admin, --admin-api-keyPlus sûr de terminer au proxyTéléchargement des modèles coupé par HF_HUB_OFFLINE=1Agents, réutilisation d'un même long prompt
LM StudioVotre PC seulement (port 1234). Ouverture au réseau local dans les réglagesVoir la doc officielleNonVoir la doc officielleTester avec une interface, Mac ou PC personnel

Vérifié dans la documentation officielle de chaque outil (et le code source pour vLLM), octobre 2026. Pour LM Studio, les points non confirmés sont marqués « Voir la doc officielle ».

  • Pour valider d'abord : llama.cpp ou Ollama, pour voir si cela sert au travail.
  • Pour toute l'entreprise : vLLM. La vitesse tient même avec beaucoup d'utilisateurs simultanés.
  • Des agents qui envoient en masse les mêmes longues consignes : SGLang.

Attention avec vLLM : la page Security officielle explique que --api-key ne protège que /v1 et quelques autres chemins, pas /invocations ni /pooling, par exemple. C'est pourquoi la documentation elle-même présente comme mesure la plus efficace un reverse proxy qui ne laisse passer que les endpoints à exposer.

05 / HARDWARE

Matériel : mémoire GPU nécessaire selon le modèle Qwen

La mémoire GPU nécessaire se calcule comme une somme de trois termes.

  • Poidsnombre de paramètres × octets par paramètre (BF16 : 2, FP8 : 1, 4 bits : env. 0,5)
  • + Cache KVproportionnel à la longueur du contexte × nombre d'utilisateurs simultanés
  • + Margeespace de travail à l'exécution

Faites défiler le tableau horizontalement →

ModèleBF16FP84 bits (INT4, etc.)Source
Qwen3-8Benv. 16 Goenv. 9,3 Goenv. 6,2 GoBenchmark de vitesse officiel de Qwen
Qwen3-14Benv. 28 Goenv. 16 Goenv. 10 GoIdem
Qwen3-32Benv. 63 Goenv. 33 Goenv. 19 GoIdem
Qwen3-235B-A22B8 GPU4 GPU4 GPU (GPTQ-INT4)Idem (configuration SGLang)
Qwen3.8-27Benv. 54 Go (poids seuls, estimation calculée)env. 27 Go (calculé). Une mesure donne env. 28,8 Go pour la version FP8 officielleenv. 14 Go (calculé). Fichiers réels autour de 17 à 18 Go (téléchargement Ollama : env. 18 Go)Calcul à partir du nombre de paramètres, mesure individuelle, bibliothèque Ollama

Pour Qwen3, valeurs du benchmark de vitesse officiel de Qwen (mémoire GPU juste après le démarrage, entrée courte traitée avec transformers). Pour Qwen3.8-27B, faute de tableau officiel, estimation calculée à partir du nombre de paramètres et mesure individuelle, cache KV non compris. Le besoin varie fortement selon la quantification et la longueur du contexte (octobre 2026).

  • Qwen3.8-27B et un GPU de 32 Go : en BF16, les poids seuls font environ 54 Go (estimation calculée) : impossible sur une seule RTX 5090 (32 Go). La version FP8 officielle pèse elle aussi environ 28,8 Go de poids, et une estimation publiée montre qu'avec le contexte maximal, 32 Go ne suffisent pas. On ajuste en passant en 4 bits ou en réduisant le contexte maximal.
  • Deux GPU de 16 Go ne valent pas un GPU de 32 Go : répartir sur deux cartes coûte la communication entre elles et l'espace de travail propre à chacune.
  • Un long contexte allonge l'attente : dans une mesure individuelle, avec environ 250 000 tokens en entrée, le premier caractère a mis plus de 4 minutes à sortir.
  • Mac : Apple Silicon partage la mémoire avec le GPU. Il faut nettement plus de mémoire que la taille du fichier du modèle.

Pour dimensionner : fixez d'abord le nombre d'utilisateurs simultanés et la longueur des documents lus en une fois. Le cache KV croît avec ces deux valeurs : si vous ne comptez que les poids, la mémoire manquera en production.

06 / BUILD

Installer sur un réseau isolé : Qwen et vLLM sur un serveur interne

Exemple avec Qwen3.8-27B en FP8, vLLM (Docker) et un serveur Linux. Les commandes suivent la documentation officielle d'octobre 2026. Si la mémoire GPU manque, réduisez le contexte maximal (--max-model-len) ou choisissez une version 4 bits.

* Architecture fictive, à titre d'illustration

Lire les commandes : remplacez les parties entre chevrons, comme <SHA-du-commit-vérifié>, par vos propres valeurs. Les numéros de version sont des exemples d'octobre 2026.

  1. Récupérer le modèle à une version figée

    Poste de transfert (côté Internet)

    Téléchargez depuis les dépôts de l'organisation officielle Qwen/, en précisant le commit. Enregistrez aussi le conteneur du moteur d'inférence à une version figée.

    bash
    pip install -U huggingface_hub
    hf download Qwen/Qwen3.8-27B-FP8 \
      --revision <SHA-du-commit-vérifié> \
      --local-dir ./Qwen3.8-27B-FP8
    
    docker pull vllm/vllm-openai:v0.30.0
    docker inspect --format '{{index .RepoDigests 0}}' vllm/vllm-openai:v0.30.0
    docker save vllm/vllm-openai:v0.30.0 -o vllm-openai-v0.30.0.tar

    Reportez dans le registre le digest affiché par docker inspect (la valeur qui commence par sha256:).

    Pourquoi figer la version : un même dépôt peut changer de contenu d'une révision à l'autre. Pour une version quantifiée, on rapporte qu'une nouvelle révision a supprimé la couche de décodage spéculatif (MTP), et que l'accélération ne se déclenchait plus.

  2. Créer le registre SHA-256

    Poste de transfert

    Le lfs.oid renvoyé par l'API Hugging Face est le SHA-256 des gros fichiers (LFS). Comparez-le à vos fichiers locaux.

    bash
    # Extraire les valeurs côté Hugging Face (fichiers LFS uniquement)
    curl -s "https://huggingface.co/api/models/Qwen/Qwen3.8-27B-FP8/tree/<SHA-du-commit-vérifié>?recursive=true&expand=true" \
      | jq -r '.[] | select(.lfs) | "\(.lfs.oid)  ./\(.path)"' > HF.sha256
    
    # Comparer aux fichiers locaux et créer le registre de tous les fichiers
    cd Qwen3.8-27B-FP8
    sha256sum -c ../HF.sha256
    find . -type f ! -path './.cache/*' -print0 | sort -z | xargs -0 sha256sum > ../MODEL.sha256
    cd .. && sha256sum vllm-openai-v0.30.0.tar > IMAGE.sha256

    Une autre personne que celle qui a téléchargé signe le registre pour validation (selon la méthode de signature de votre entreprise).

  3. Transférer sur support, vérifier avant de charger

    Serveur du réseau isolé

    Transférez le registre et les fichiers sur support, puis refaites la vérification côté isolé. Une seule ligne FAILED, et on n'utilise pas.

    bash
    cd /srv/llm/models/Qwen3.8-27B-FP8 && sha256sum -c /srv/llm/incoming/MODEL.sha256
    cd /srv/llm/incoming && sha256sum -c IMAGE.sha256
    docker load -i vllm-openai-v0.30.0.tar
  4. Démarrer en écoute sur 127.0.0.1 uniquement

    Serveur du réseau isolé

    Sans --host, vLLM écoute sur toutes les interfaces. Écrivez toujours --host 127.0.0.1 et passez la clé par un fichier (en ligne de commande, elle est visible avec ps).

    bash · vLLM (Docker)
    # Créer le fichier de clé avec les droits 600
    sudo install -D -m 600 /dev/null /etc/llm/vllm.env
    echo "VLLM_API_KEY=$(openssl rand -hex 32)" | sudo tee /etc/llm/vllm.env > /dev/null
    
    sudo docker run -d --name qwen --gpus all --ipc=host --network host \
      -v /srv/llm/models:/models:ro \
      -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \
      --env-file /etc/llm/vllm.env \
      vllm/vllm-openai:v0.30.0 \
      --model /models/Qwen3.8-27B-FP8 \
      --served-model-name qwen3.8-27b \
      --host 127.0.0.1 --port 8000 \
      --max-model-len 65536 --gpu-memory-utilization 0.90
    
    # Vérifier l'écoute sur 127.0.0.1:8000 uniquement
    ss -ltnp | grep 8000
    • Pas de --trust-remote-code. Pour ne pas exécuter le code livré avec le modèle.
    • Pas de VLLM_SERVER_DEV_MODE=1 en production. Il expose des endpoints de développement.
    • Mode réflexion et appels d'outils : la documentation officielle de Qwen cite, pour Qwen3, --reasoning-parser qwen3 et --enable-auto-tool-choice --tool-call-parser hermes. Pour la génération 3.8, vérifiez dans la fiche du modèle.
    bash · avec Ollama (systemd)
    sudo systemctl edit ollama
    # Écrire ces 3 lignes dans le fichier ouvert, puis enregistrer
    [Service]
    Environment="OLLAMA_HOST=127.0.0.1:11434"
    Environment="OLLAMA_NO_CLOUD=1"
    
    sudo systemctl restart ollama
    bash · avec SGLang ou llama.cpp
    python3 -m sglang.launch_server --model-path /models/Qwen3.8-27B-FP8 \
      --host 127.0.0.1 --port 30000 --api-key <clé> --admin-api-key <clé-admin>
    
    llama-server -m /models/qwen.gguf --host 127.0.0.1 --port 8080 \
      --api-key-file /etc/llm/keys --offline --no-webui --jinja

    Dans l'exemple SGLang aussi, n'écrivez pas la clé en clair : passez-la en pratique par un fichier ou une variable d'environnement. Les exemples des fiches de modèles utilisent --host 0.0.0.0 : ne les copiez pas tels quels.

  5. TLS, liste d'autorisation et authentification avec nginx

    Serveur du réseau isolé (passerelle)

    Les utilisateurs n'ont accès qu'à nginx. Seules les routes nécessaires de /v1 passent ; tout le reste renvoie 404.

    nginx
    server {
      listen 443 ssl;
      server_name llm.internal.example;
      ssl_certificate     /etc/pki/llm.crt;
      ssl_certificate_key /etc/pki/llm.key;
      ssl_protocols TLSv1.2 TLSv1.3;
    
      allow 10.20.0.0/16;   # segment interne uniquement
      deny  all;
    
      location = /v1/chat/completions {
        auth_request /_auth;
        auth_request_set $user $upstream_http_x_auth_request_user;
        proxy_set_header Authorization "Bearer <clé-amont>";
        proxy_pass http://127.0.0.1:8000;
        proxy_buffering off;   # pour les réponses en streaming
      }
      location = /v1/models {
        auth_request /_auth;
        auth_request_set $user $upstream_http_x_auth_request_user;
        proxy_set_header Authorization "Bearer <clé-amont>";
        proxy_pass http://127.0.0.1:8000;
      }
      location = /_auth {
        internal;
        proxy_pass http://127.0.0.1:4180/oauth2/auth;   # lien avec l'IdP interne via oauth2-proxy, par ex.
      }
      location / { return 404; }   # ne pas exposer /metrics, /invocations, etc.
    }

    Les utilisateurs s'identifient par le SSO interne (OIDC ou SAML), et la clé d'API amont ne leur est jamais distribuée. auth_request est un module nginx : nginx -V indique s'il est inclus dans votre build.

  6. Bloquer le trafic sortant

    Serveur du réseau isolé

    Par défaut, refusez toute connexion du serveur vers Internet. N'autorisez que le DNS interne, la synchronisation de l'heure et le collecteur de logs.

    bash · ufw
    sudo ufw default deny incoming
    sudo ufw default deny outgoing
    sudo ufw allow in on <interface-admin> to any port 22 proto tcp    # à autoriser d'abord, sinon SSH coupe
    sudo ufw allow in on <interface-interne> to any port 443 proto tcp
    sudo ufw allow out to <DNS-interne> port 53 proto udp
    sudo ufw allow out to <NTP-interne> port 123 proto udp
    sudo ufw allow out to <collecteur-logs> port 514 proto tcp
    sudo ufw enable
    
    # Vérifier qu'on ne peut pas sortir (l'échec est le bon résultat)
    curl -m 5 https://huggingface.co

    Si vous publiez un port avec -p dans Docker, Docker ajoute ses propres règles de filtrage : le port peut rester joignable de l'extérieur même si ufw semble le fermer. Ces étapes utilisent --network host et --host 127.0.0.1 pour limiter l'écoute à la machine locale.

    bash · avec -p
    # Publier côté hôte sur 127.0.0.1 uniquement (-p 8000:8000 publie sur toutes les interfaces)
    sudo docker run -d --name qwen --gpus all --ipc=host \
      -p 127.0.0.1:8000:8000 \
      -v /srv/llm/models:/models:ro \
      -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \
      --env-file /etc/llm/vllm.env \
      vllm/vllm-openai:v0.30.0 \
      --model /models/Qwen3.8-27B-FP8 --served-model-name qwen3.8-27b \
      --host 0.0.0.0 --port 8000 --max-model-len 65536
    # ↑ écoute sur 0.0.0.0 dans le conteneur, mais exposé sur 127.0.0.1 seulement côté hôte

    Dans cette configuration, vLLM écoute sur 0.0.0.0 à l'intérieur du conteneur, mais reste injoignable depuis l'extérieur de l'hôte. Bloquez aussi le trafic sortant au niveau du pare-feu réseau.

  7. Conserver logs et traces d'audit

    Passerelle, supervision

    Qui, quand, quel endpoint : consignez-le dans les logs nginx et envoyez-les vers la plateforme de logs interne (SIEM, etc.). Comptez les tokens via /metrics (format Prometheus), exposé uniquement sur le réseau de supervision.

    nginx · dans http { }
    log_format llm '$time_iso8601 user=$user ip=$remote_addr "$request" '
                   'status=$status bytes=$body_bytes_sent rt=$request_time';
    access_log /var/log/nginx/llm.log llm;

    Si vous activez --enable-log-requests dans vLLM au niveau DEBUG, le texte des prompts apparaît dans les logs. Conserver ou non ce texte, et combien de temps, se décide selon vos règles sur les données personnelles et la confidentialité.

  8. Définir utilisateurs et droits

    Interface (Open WebUI, etc.)

    Pour un usage en chat, placez une interface comme Open WebUI dans le même réseau isolé, et répartissez les modèles accessibles par rôle et par groupe. Les départs sont bloqués via l'IdP interne.

    env · Open WebUI
    OFFLINE_MODE=true
    ENABLE_SIGNUP=false
    DEFAULT_USER_ROLE=pending
    ENABLE_COMMUNITY_SHARING=false

    Avec OFFLINE_MODE activé, la recherche documentaire (RAG) ne fonctionne pas si le modèle d'embedding n'a pas été installé au préalable. Apportez-le selon le même circuit que les étapes 1 à 3.

  9. Fixer le circuit de mise à jour

    Poste de transfert → test → production

    vLLM sort une version environ toutes les deux semaines, presque toujours avec des correctifs de sécurité. Même en réseau isolé, mettez à jour régulièrement selon le circuit « récupérer → tester → registre → production ».

    bash
    # 1. Récupérer, vérifier et transférer la nouvelle version comme aux étapes 1 à 3
    # 2. En environnement de test, poser les mêmes questions à l'ancienne et à la nouvelle version
    # 3. Lister les variables d'environnement utilisées et vérifier dans les notes de version qu'elles existent toujours
    sudo docker inspect --format '{{range .Config.Env}}{{println .}}{{end}}' qwen \
      | grep -E '^(VLLM_|HF_)' | cut -d= -f1
    # 4. Après la mise en production, noter en une ligne qui a mis à jour, quand, et quand on est revenu en arrière
    echo "$(date -I) vllm <ancienne>→<nouvelle> resp:<nom> test:OK retour:<ancienne>.tar" >> /srv/llm/CHANGELOG

    Gardez le conteneur et le modèle de la version précédente, avec leur digest, pour pouvoir revenir en arrière. Comparez avant et après les valeurs qui changent d'une version à l'autre, comme la longueur maximale du contexte.

07 / CHECKLIST

Checklist de sécurité d'un LLM local : 20 points avant la production

Avant et après l'installation, vérifiez dans l'ordre. Les cases ne servent que dans cette page : rien n'est envoyé.

0 / 20 vérifiés

Récupérer modèles et conteneurs

Écoute et trafic sortant

Point d'entrée et authentification

Droits, traces, exploitation

08 / MISTAKES

Erreurs fréquentes : les failles du « ça devrait aller »

À gauche, l'erreur fréquente ; à droite, la parade avec les étapes de cette page.

  • --host 0.0.0.0 sans authentificationLa commande d'exemple, copiée telle quelle, ouvre le serveur à tout le réseau local.
    127.0.0.1 + nginxÉcoute locale seulement. Les utilisateurs passent par la passerelle.
  • Une version modifiée d'origine inconnueUn GGUF communautaire « Uncensored » utilisé sans vérifier sa provenance.
    Depuis Qwen/ officiel, SHA figéPour une version tierce, consigner l'auteur et la procédure.
  • « Il y a une api-key, donc c'est sûr »Croire que la clé de vLLM protège tous les endpoints.
    Filtrer par liste d'autorisationNe laisser passer que le nécessaire, comme /v1/chat/completions.
  • « C'est sur site, donc c'est sûr »Faire l'impasse sur les droits, les logs et le contrôle d'accès du RAG parce que c'est interne.
    En interne, la même rigueurSSO, rôles, logs, recherche qui respecte les droits de lecture.
  • Un tunnel pour l'utiliser de l'extérieurUn outil interne exposé sur Internet via Cloudflare Tunnel ou équivalent.
    Depuis le réseau interne seulementPour un accès externe, passer par l'accès distant officiel de l'entreprise.
  • Ignorer le trafic sortant par défautStatistiques d'usage de vLLM, mises à jour automatiques d'Ollama desktop.
    Variables d'environnement et blocage sortantCouper dans la config, et aussi au pare-feu.
  • Trop en demander à un petit modèleEn agent ou en appel d'outils, il invente des fichiers ou des liens.
    Un premier jet, pas plusExécution en bac à sable, résultats vérifiés par un humain.
  • La mise à jour qui casseUne variable d'environnement disparue ou une limite changée, et plus rien ne tourne.
    Comparer avant/après en testCroiser avec les notes de version, noter qui a mis à jour.
09 / FROM THE VIDEOS

Ce que disent les vidéos : Qwen auto-hébergé en pratique

Nous avons vérifié, jusqu'à la transcription audio, 18 vidéos explicatives en anglais, chinois et japonais publiées entre février et octobre 2026.

Ce que disent ces 18 vidéos8 scènes, et ce qui ressort de l'ensemble

D'après les propos : 8 scènes

  1. Ce qui s'est passé dans une banque (rapporté) : l'intervenant d'une conférence raconte le cas d'une banque cliente : un employé a fait anonymiser un fichier de données personnelles par un outil d'IA souscrit à titre personnel ; trois minutes plus tard, la sécurité informatique appelait, avec rapport et sanction à la clé (paraphrase).
    Will 保哥 (conférence) · vidéo, à partir de 1:39:00
  2. Le danger, c'est le harnais : dans la même conférence : « avec un agent, le danger n'est pas le modèle mais le harnais (ce qui écrit des fichiers et communique autour). Le modèle ne fait qu'enchaîner des caractères dans le GPU » (paraphrase). C'est la raison du point 19 (bac à sable) de la checklist.
    Will 保哥 (conférence) · vidéo, à partir de 1:21:00
  3. Pourquoi figer la version : « une nouvelle révision d'une version quantifiée a supprimé la couche MTP, et le décodage spéculatif ne se déclenchait plus. D'où le commit figé » (paraphrase). C'est la raison du « version figée » de l'étape 1.
    RepoChad · vidéo, à partir de 4:05
  4. Le port 11434 n'a pas de clé : « l'API d'Ollama sur localhost:11434 n'a pas d'authentification par défaut. Sur un serveur, on la contrôle par reverse proxy ou pare-feu » (paraphrase).
    Chaîne japonaise sur l'open source · vidéo, à partir de 10:00
  5. Ne pas ouvrir le 8000 au monde : en testant sur un GPU cloud : « je ne veux pas ouvrir le port 8000 au monde entier, donc je passe par une redirection de port SSH » (paraphrase). Une solution de phase de test, avant d'avoir le TLS.
    The Cef Experience · vidéo, à partir de 9:31
  6. Sur site, mais trop visible : « si l'on néglige la gestion des droits, l'IA finit par répondre sur les salaires ou les RH, que personne ne devrait voir. L'installer en interne ne suffit pas à la sécuriser » (paraphrase).
    Chaîne japonaise sur la gestion d'entreprise · vidéo, à partir de 24:30
  7. Une ligne pour tracer les mises à jour : « figer la version actuelle, garder le tag, et noter en une ligne qui a mis à jour quand, et quand on est revenu en arrière. Ça sauve en cas d'incident » (paraphrase). C'est la forme de trace de l'étape 9.
    Chaîne japonaise d'actualité IA · vidéo, à partir de 7:01
  8. Le temps aussi coûte : après deux jours d'essais avec Ollama et un tunnel, retour au cloud : « le gratuit a des coûts cachés. Le temps aussi est un coût » (paraphrase).
    Garfield_Investment · vidéo, à partir de 8:02

Certaines vidéos montrent comment contourner l'activation de logiciels commerciaux avec des modèles modifiés non officiels : ne les imitez pas. Les étapes de cette page n'utilisent aucune version modifiée d'origine inconnue.

Ce qui ressort des 18 vidéos

  • Secret professionnel : un expert-comptable a monté une IA fiscale qui tourne Wi-Fi coupé, avec un seul Mac, Ollama, Qwen3 et Open WebUI. Il reconnaît que les calculs d'impôt en plusieurs étapes restent difficiles et que, pour l'instant, le cloud avec l'accord du client reste le meilleur choix.
  • Air gap : quatre étapes : répliquer les outils, apporter physiquement le modèle, lancer le moteur d'inférence depuis le stockage interne au réseau isolé. Avec évaluation et passerelle en plus.
  • Quel moteur pour qui : llama.cpp pour un utilisateur, vLLM pour beaucoup, SGLang pour des agents qui réutilisent les mêmes longues consignes. Certains défendent aussi Linux plutôt que Windows en production.
  • Deux GPU ne font pas un grand GPU : la communication entre cartes devient le goulot, et la vitesse pour un seul utilisateur change peu. Ce qu'on gagne, ce sont les connexions simultanées et la longueur du contexte : plusieurs vidéos l'expliquent.
  • L'attente des longs contextes : avec Qwen3.8-27B sur deux GPU de 16 Go, environ 250 000 tokens en entrée ont demandé plus de 4 minutes avant le premier caractère.

Les propos sont des paraphrases de transcriptions automatiques de l'audio, pas des citations mot pour mot. Les horodatages sont indicatifs : le passage peut venir une trentaine de secondes après le lien. Les chiffres valent pour la configuration de chaque vidéo.

10 / SIMY

Et SIMY ? Qwen dans le réseau isolé, SIMY à l'extérieur

Soyons francs : à ce jour, SIMY ne tourne pas sur Qwen, ni dans un réseau isolé, ni hors ligne.

* Répartition fictive, à titre d'illustration

  • Capté en réunion et en chat
  • À votre façon
  • Seulement les décisions

Le texte confidentiel reste traité par le Qwen isolé. Ensuite, pour « qui fait quoi, et pour quand », SIMY fait avancer la partie que l'entreprise a décidé de laisser sortir, dans des outils qu'elle autorise.

  • Comment SIMY fonctionne : l'exécution dans le cloud passe par votre compte ChatGPT (Codex). L'usage de Codex s'inscrit dans votre offre ChatGPT.
  • Exécution sur PC : l'application de bureau SIMY peut confier l'exécution à Claude Code sur votre PC. Télécharger l'application.
  • Lecture de l'historique des conversations : l'application de bureau lit l'historique de Claude Code et de Codex et transforme le travail répétitif en « suggestions de SIMY ». Le texte des conversations n'est pas stocké sur nos serveurs. Les PC et le périmètre concernés se décident selon vos règles internes.

Où tracer la ligne : ce qui reste dans le réseau isolé et ce qui peut passer par des outils externes, ce sont les règles de l'entreprise qui le décident. Le traitement des données par SIMY est décrit dans les pages Sécurité et Politique de confidentialité.

11 / FAQ

LLM local et Qwen : questions fréquentes

Qu'est-ce qu'un LLM local ?

C'est faire tourner les poids publiés d'un modèle sur votre PC ou sur les serveurs de l'entreprise. Le texte saisi ne quitte pas la machine : on peut donc y traiter des documents confidentiels.

Que peut-on faire avec un LLM local ?

Résumer et rédiger des documents confidentiels, répondre à des questions sur les documents internes (RAG), traduire et aider au code. Un petit modèle convient mieux à un premier jet qu'à une version finale.

Quel LLM local choisir ?

Pour tester, Qwen3 de 4B à 8B ; pour un service, Qwen3-14B, 32B ou Qwen3.8-27B ; pour le code, Qwen3-Coder (octobre 2026). Avant d'acheter un gros GPU, vérifiez sur votre PC actuel s'il convient pour un premier jet.

Qwen est-il gratuit en local ?

Les modèles sous Apache 2.0 sont sans frais d'utilisation, y compris en usage commercial. Mais GPU, serveurs, électricité et exploitation sont à votre charge, et certains modèles ont une licence propre.

Quelle configuration pour faire tourner Qwen en local ?

Selon les chiffres officiels de Qwen, Qwen3-8B utilise environ 16 Go de mémoire GPU en BF16, et Qwen3-32B environ 33 Go en FP8. Ces valeurs portent surtout sur les poids : le cache KV s'y ajoute, proportionnel au nombre d'utilisateurs et à la longueur du contexte.

Qwen3.8-27B tourne-t-il sur une seule RTX 5090 ?

En version quantifiée 4 bits, oui, sur une RTX 5090 de 32 Go. En BF16, les poids seuls font environ 54 Go (estimation calculée) : impossible. La version FP8 pèse environ 29 Go de poids : elle ne tient qu'en réduisant fortement le contexte maximal.

Quelle différence entre Ollama et vLLM ?

Ollama sert à tester facilement ; vLLM est un moteur de production pour de nombreux utilisateurs simultanés. Ollama n'écoute par défaut que sur 127.0.0.1, alors que vLLM écoute sur toutes les interfaces sans --host : il faut toujours le préciser.

Faut-il mettre à jour même en réseau isolé ?

Oui. vLLM sort une version environ toutes les deux semaines, presque toujours avec des correctifs de sécurité. Fixez un circuit : récupérer sur le poste de transfert, comparer en test, puis passer en production.

Qwen est-il utilisable commercialement ?

Les modèles sous Apache 2.0 (Qwen3, Qwen3.8-27B, etc.) le sont. Qwen2.5-3B, 72B ou Qwen3.8-Flash-Next ont d'autres licences : vérifiez avec votre service juridique le fichier LICENSE du modèle utilisé.

Qwen comprend-il le français ?

Oui. L'annonce de la génération Qwen3 revendique 119 langues et dialectes, dont le français. Les petits modèles peuvent manquer de naturel sur de longs textes : relisez les textes importants avant de les utiliser.

Qwen tourne-t-il sur Mac ?

Oui. Ollama, LM Studio et llama.cpp fonctionnent sur Mac. Apple Silicon partage la mémoire avec le GPU : il faut nettement plus de mémoire que la taille du fichier du modèle.

Sur site, est-ce sûr ?

Pas à lui seul. C'est seulement après avoir défini l'adresse d'écoute, l'authentification, le trafic sortant, les logs et les droits de lecture sur les documents internes qu'on peut affirmer que rien ne sort.

SIMY fonctionne-t-il en réseau isolé ?

Non. À ce jour, SIMY ne tourne ni dans un réseau isolé, ni hors ligne, ni sur Qwen. On peut répartir ainsi : le texte confidentiel traité par le Qwen isolé, et la suite, dans le périmètre autorisé par l'entreprise, avancée par SIMY.

12 / SOURCES

Sources

Étapes, réglages par défaut et licences ont été vérifiés dans les sources officielles suivantes (le 1er octobre 2026). Versions et valeurs par défaut changent souvent : consultez chaque page officielle avant l'installation.

Le confidentiel, sur votre Qwen.
La suite, avec SIMY.

Dans le réseau isolé : les étapes et la checklist de cette page. Pour le travail que l'entreprise autorise, SIMY le capte dans vos réunions et vos chats, le fait avancer, et ne vous renvoie que les décisions.