Índice
Datos que no puedes pegar en una IA externa: ¿te pasa esto?
Sabes que con IA iría más rápido. Pero esa conversación no puede salir de la empresa.
Lo pasó a una IA de su cuenta personal para anonimizarlo. Llamó Seguridad de la Información y tocó escribir un informe.
Legal lo frenó: «no se puede enviar a una IA externa». Todos ven la utilidad, pero no avanza.
Probaste con Ollama y funcionó. Pero no sabes explicar quién puede conectarse.
Como no puede salir, no se usa IA. Entre esas dos opciones hay una tercera: ejecutarla en tu propio servidor.
* Los casos 1 y 2 se basan en ejemplos contados en vídeos explicativos (Lo que cuentan los vídeos).
Lo que querías: lo confidencial, en el Qwen de tu empresa
Los mismos documentos, las mismas reuniones. La IA ayuda y los datos no salen de la empresa.
Los datos no salen del servidor. No hace falta pegarlos en una IA externa.
Dónde escucha, autenticación, tráfico saliente y logs. Puedes mostrar dónde se corta.
Descarga, validación, registro y producción. El mismo flujo, lo haga quien lo haga.
«¿Subimos a esta versión?». Con la comparación del antes y el después, decides esa única pregunta.
Todo esto se consigue con los pasos y la checklist de esta página. Cómo repartir también la organización del trabajo tras la reunión está en Qué papel tiene SIMY.
Qué es un LLM local y por qué ejecutar Qwen en tu empresa
Un LLM local consiste en ejecutar los pesos publicados de un modelo en tu propio PC o en un servidor de la empresa. El texto que introduces no sale de esa máquina.
| Nombre | Dónde se ejecuta | Cuándo encaja |
|---|---|---|
| LLM local | Tu propio PC (Mac o Windows) | Probar en solitario, usarlo sin conexión |
| LLM on-premise o interno | Servidores o centro de datos de la empresa | Uso simultáneo en un departamento o en toda la empresa |
| LLM en red aislada | Dentro de una red sin conexión a internet | Secreto profesional, datos personales, información de diseño |
Qué puedes hacer con un LLM local
- Resumir y redactar documentos confidenciales: actas, contratos, especificaciones de diseño, comunicaciones con clientes.
- Buscar y preguntar sobre documentos internos (RAG): le das normativas y manuales internos y responde preguntas.
- Traducción y ayuda con código: traducir entre chino, inglés y español, explicar código interno o proponer cambios.
Los modelos pequeños no son tan capaces como los grandes modelos en la nube. Si los usas para hacer un «primer borrador» y no la versión final, habrá menos sorpresas.
Por qué Qwen
- Hay modelos Apache 2.0
- Multilingüe, español incluido
- Tamaños a elegir
- Licencia: muchos modelos, como Qwen3 o Qwen3.8-27B, se publican con Apache 2.0. Pero no todos (ver la tabla de abajo).
- Idiomas: en el anuncio de la generación Qwen3 se mencionan 119 idiomas y dialectos, entre ellos el español.
- Tamaño: desde 0,6B–8B, que funcionan en un PC, pasando por 27B–32B, que cuantizados caben en una sola GPU, hasta 235B, que necesita varias GPU.
La licencia cambia según el modelo
Puedes desplazar la tabla en horizontal →
| Modelo | Licencia | Grado de verificación |
|---|---|---|
| Qwen3 (0.6B–32B, 30B-A3B, 235B-A22B-2507), Qwen3-VL, Qwen3-Coder, Qwen3-Embedding y Reranker | Apache 2.0 | Verificado en Hugging Face |
| Qwen3.5 (0.8B–35B-A3B), Qwen3.6 (27B, 35B-A3B), Qwen3.8-27B (incluida la versión FP8) | Apache 2.0 | Verificado en Hugging Face |
| La mayoría de Qwen2.5 (0.5B–32B, Coder 7B y 14B, VL-7B) | Apache 2.0 | Verificado en Hugging Face |
| Qwen2.5-3B, Qwen2.5-VL-3B | qwen-research (investigación; el uso comercial va aparte) | Solo el nombre. Revisar el texto |
| Qwen2.5-72B-Instruct, Qwen2.5-VL-72B | qwen (licencia propia) | Solo el nombre. Revisar las condiciones |
| Qwen3.8-2.4T-A95B | Licencia propia | Verificado en Hugging Face |
| Qwen3.8-Flash-Next | qwen-community-1.0. Según se indica, ofrecerlo como MaaS o usarlo como «AI work assistant» (ayuda con código, ofimática, etc.) requiere otra licencia | Verificado en un resumen. Requiere revisión legal |
Verificado el 1 de octubre de 2026 en la información de modelos de la organización Qwen en Hugging Face. No es cierto que «todo Qwen sea Apache 2.0». Antes de un uso comercial, revisa con tu equipo legal el archivo LICENSE del repositorio del modelo que vayas a usar.
LLM local recomendado: qué Qwen elegir según el usoOctubre de 2026. Si dudas, empieza en pequeño
- Probar primero en un PC: Qwen3 de 4B a 8B o los modelos pequeños de Qwen3.5. Funcionan con Ollama o LM Studio y te dicen si sirven para tu trabajo.
- Resúmenes y borradores para un departamento: Qwen3-14B o 32B, o Qwen3.8-27B. Las versiones FP8 o de 4 bits caben en una sola GPU; la que además maneja imágenes es la 3.8-27B.
- Ayuda con código: Qwen3-Coder (30B-A3B). Es un MoE con pocos parámetros activos y va rápido para su tamaño.
- Búsqueda en documentos internos: además del modelo que responde, combina Qwen3-Embedding y Reranker.
Si fijas un solo uso antes de probar, es más fácil saber qué tamaño basta. Antes de comprar una GPU grande, lo más rápido es comprobar con el PC que ya tienes si sirve como «primer borrador».
El uso de Qwen en sí (Qwen Chat, API, modelos principales) está en la guía de Qwen, y la comparación con otros modelos chinos, en la comparativa de IA china (LLM).
Elegir motor: Ollama, llama.cpp, vLLM, SGLang o LM Studio
El software que ejecuta el modelo es el «motor de inferencia». En seguridad, la mayor diferencia es dónde escucha si no tocas nada.
Puedes desplazar la tabla en horizontal →
| Motor | Escucha por defecto | Autenticación propia | TLS | Tráfico saliente | Uso recomendado |
|---|---|---|---|---|---|
| Ollama | 127.0.0.1:11434 | No figura en las FAQ oficiales. Se hace con un proxy | No. Se termina en el proxy | Las funciones en la nube se desactivan con OLLAMA_NO_CLOUD=1. Las versiones de Mac y Windows buscan actualizaciones solas | Pruebas individuales o de equipos pequeños, Mac |
| llama.cpp (llama-server) | 127.0.0.1:8080 | --api-key, --api-key-file | --ssl-key-file, --ssl-cert-file | --offline desactiva las comprobaciones de red | Uso individual, GGUF, CPU, Apple, AMD |
| vLLM | Sin --host, todas las interfaces (puerto 8000) | --api-key o VLLM_API_KEY. Solo protege parte, como /v1 | --ssl-keyfile, --ssl-certfile | Envía estadísticas de uso por defecto. Se desactiva con VLLM_NO_USAGE_STATS=1 | Producción con muchos usuarios a la vez en un departamento o toda la empresa |
| SGLang | 127.0.0.1:30000 | --api-key. Para administración, --admin-api-key | Lo prudente es terminarlo en un proxy | Las descargas de modelos se cortan con HF_HUB_OFFLINE=1 | Agentes, reutilizar el mismo prompt largo |
| LM Studio | Solo tu PC (puerto 1234). La exposición a la LAN se activa en los ajustes | Consultar la documentación oficial | No | Consultar la documentación oficial | Probar con interfaz gráfica, Mac o PC personal |
Verificado en la documentación oficial de cada proyecto (en vLLM, también en el código fuente) en octubre de 2026. En la fila de LM Studio, lo que no pudimos verificar del todo figura como «Consultar la documentación oficial».
- Para comprobar primero: llama.cpp u Ollama, para ver si sirve para tu trabajo.
- Para toda la empresa: vLLM. Mantiene la velocidad aunque lo usen muchas personas a la vez.
- Agentes que envían muchas veces las mismas instrucciones largas: SGLang.
Ojo con vLLM: su página oficial de Security explica que --api-key solo protege rutas como /v1, y que /invocations o /pooling, entre otras, quedan fuera. Por eso la propia documentación considera que lo más eficaz es ponerlo detrás de un proxy inverso que deje pasar solo los endpoints que quieras publicar.
Hardware: memoria de GPU necesaria según el modelo de Qwen
La memoria de GPU necesaria se calcula como una suma de tres partes.
- PesosNúmero de parámetros × bytes por parámetro (BF16: 2, FP8: 1, 4 bits: ~0,5)
- + Caché KVProporcional a la longitud del contexto × usuarios simultáneos
- + MargenEspacio de trabajo en ejecución
Puedes desplazar la tabla en horizontal →
| Modelo | BF16 | FP8 | 4 bits (INT4, etc.) | Fuente |
|---|---|---|---|---|
| Qwen3-8B | ~16 GB | ~9,3 GB | ~6,2 GB | Benchmark de velocidad oficial de Qwen |
| Qwen3-14B | ~28 GB | ~16 GB | ~10 GB | Ídem |
| Qwen3-32B | ~63 GB | ~33 GB | ~19 GB | Ídem |
| Qwen3-235B-A22B | 8 GPU | 4 GPU | 4 GPU (GPTQ-INT4) | Ídem (configuración con SGLang) |
| Qwen3.8-27B | ~54 GB (solo pesos, estimación calculada) | ~27 GB (calculado). Un caso medido da ~28,8 GB para la versión FP8 oficial | ~14 GB (calculado). Los archivos reales rondan 17–18 GB (la descarga de Ollama ocupa ~18 GB) | Cálculo a partir de los parámetros, caso medido, biblioteca de Ollama |
Los valores de Qwen3 son los del benchmark de velocidad oficial de Qwen (memoria de GPU justo tras el arranque, procesando una entrada corta con transformers). Para Qwen3.8-27B no hay tabla oficial, así que son estimaciones calculadas a partir de los parámetros y un caso medido por un particular, sin la caché KV. La cantidad necesaria cambia mucho según la cuantización y la longitud del contexto (octubre de 2026).
- Qwen3.8-27B y una GPU de 32 GB: en BF16 solo los pesos ocupan ~54 GB (estimación), así que no cabe en una RTX 5090 (32 GB). La versión FP8 oficial ocupa ~28,8 GB solo en pesos, y se ha publicado un cálculo según el cual con el contexto al máximo no entra en 32 GB. Se ajusta usando una versión de 4 bits o bajando el límite de contexto.
- Dos GPU de 16 GB no equivalen a una de 32 GB: al repartir, se pierde por la comunicación entre tarjetas y por el espacio de trabajo que necesita cada una.
- Los contextos largos alargan la espera: en un caso medido por un particular, con una entrada de ~250 000 tokens, el primer carácter tardó más de 4 minutos.
- Mac: en Apple Silicon la memoria se comparte con la GPU. Necesitas bastante más memoria que el tamaño del archivo del modelo.
Cómo dimensionar: decide primero cuántas personas lo usarán a la vez y qué longitud tendrán los documentos de cada consulta. La caché KV crece en proporción a ambos, así que si solo cuentas los pesos, te quedarás corto en producción.
Montaje en red aislada: Qwen + vLLM en un servidor interno
El ejemplo usa la versión FP8 de Qwen3.8-27B con vLLM (Docker) en un servidor Linux. Los comandos siguen la documentación oficial de octubre de 2026. Si no te llega la memoria de GPU, baja el límite de contexto (--max-model-len) o elige una versión de 4 bits.
* Arquitectura de ejemplo con fines ilustrativos
Cómo leer los comandos: sustituye lo que va entre ángulos, como <SHA-del-commit-verificado>, por los valores de tu empresa. Los números de versión son ejemplos de octubre de 2026.
-
Descargar el modelo con la versión fijada
Equipo de entrada (lado internet)Descarga del repositorio de la organización oficial
Qwen/, indicando el commit. Guarda también el contenedor del motor de inferencia con la versión fijada.bashpip install -U huggingface_hub hf download Qwen/Qwen3.8-27B-FP8 \ --revision <SHA-del-commit-verificado> \ --local-dir ./Qwen3.8-27B-FP8 docker pull vllm/vllm-openai:v0.30.0 docker inspect --format '{{index .RepoDigests 0}}' vllm/vllm-openai:v0.30.0 docker save vllm/vllm-openai:v0.30.0 -o vllm-openai-v0.30.0.tarCopia en el registro el digest que muestra
docker inspect(el valor que empieza porsha256:).Por qué fijar la versión: en un mismo repositorio, una revisión nueva puede cambiar el contenido. Se ha contado el caso de una versión cuantizada cuya revisión nueva eliminó las capas de decodificación especulativa (MTP), y la aceleración dejó de activarse.
-
Crear el registro de SHA-256
Equipo de entradaEl
lfs.oidque devuelve la API de Hugging Face es el SHA-256 de los archivos grandes (LFS). Compara ese valor con tus archivos locales.bash# Extraer los valores de Hugging Face (solo archivos LFS) curl -s "https://huggingface.co/api/models/Qwen/Qwen3.8-27B-FP8/tree/<SHA-del-commit-verificado>?recursive=true&expand=true" \ | jq -r '.[] | select(.lfs) | "\(.lfs.oid) ./\(.path)"' > HF.sha256 # Comparar con los archivos locales y crear el registro de todos los archivos cd Qwen3.8-27B-FP8 sha256sum -c ../HF.sha256 find . -type f ! -path './.cache/*' -print0 | sort -z | xargs -0 sha256sum > ../MODEL.sha256 cd .. && sha256sum vllm-openai-v0.30.0.tar > IMAGE.sha256Una persona distinta de quien descargó firma el registro como verificado (el método de firma sigue el estándar de tu empresa).
-
Trasladar en soporte físico y verificar antes de cargar
Servidor en red aisladaPasa el registro y los archivos en un soporte físico y vuelve a comparar en el lado aislado. Si aparece un solo
FAILED, no se usa.bashcd /srv/llm/models/Qwen3.8-27B-FP8 && sha256sum -c /srv/llm/incoming/MODEL.sha256 cd /srv/llm/incoming && sha256sum -c IMAGE.sha256 docker load -i vllm-openai-v0.30.0.tar -
Arrancar escuchando solo en 127.0.0.1
Servidor en red aisladaSin
--host, vLLM escucha en todas las interfaces. Escribe siempre--host 127.0.0.1y pasa la clave por archivo (en la línea de comandos se ve conps).bash · vLLM (Docker)# Crear el archivo de la clave con permisos 600 sudo install -D -m 600 /dev/null /etc/llm/vllm.env echo "VLLM_API_KEY=$(openssl rand -hex 32)" | sudo tee /etc/llm/vllm.env > /dev/null sudo docker run -d --name qwen --gpus all --ipc=host --network host \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 \ --served-model-name qwen3.8-27b \ --host 127.0.0.1 --port 8000 \ --max-model-len 65536 --gpu-memory-utilization 0.90 # Comprobar que solo escucha en 127.0.0.1:8000 ss -ltnp | grep 8000- No uses
--trust-remote-code. Así no se ejecuta el código incluido con el modelo. - No uses
VLLM_SERVER_DEV_MODE=1en producción. Expone endpoints de desarrollo. - Modo de razonamiento y llamadas a herramientas: la documentación oficial de Qwen pone como ejemplo para Qwen3
--reasoning-parser qwen3y--enable-auto-tool-choice --tool-call-parser hermes. Para la generación 3.8, consulta la ficha del modelo.
bash · con Ollama (systemd)sudo systemctl edit ollama # En el archivo que se abre, escribe estas 3 líneas y guarda [Service] Environment="OLLAMA_HOST=127.0.0.1:11434" Environment="OLLAMA_NO_CLOUD=1" sudo systemctl restart ollamabash · con SGLang o llama.cpppython3 -m sglang.launch_server --model-path /models/Qwen3.8-27B-FP8 \ --host 127.0.0.1 --port 30000 --api-key <clave> --admin-api-key <clave-admin> llama-server -m /models/qwen.gguf --host 127.0.0.1 --port 8080 \ --api-key-file /etc/llm/keys --offline --no-webui --jinjaEn el ejemplo de SGLang tampoco escribas la clave directamente: en la práctica, pásala desde un archivo o una variable de entorno. Los ejemplos de la ficha del modelo usan
--host 0.0.0.0, así que no los copies tal cual. - No uses
-
TLS, lista de permitidos y autenticación con nginx
Servidor en red aislada (gateway)Los usuarios solo tocan nginx. Deja pasar solo lo necesario de
/v1y devuelve 404 para todo lo demás.nginxserver { listen 443 ssl; server_name llm.internal.example; ssl_certificate /etc/pki/llm.crt; ssl_certificate_key /etc/pki/llm.key; ssl_protocols TLSv1.2 TLSv1.3; allow 10.20.0.0/16; # solo el segmento interno deny all; location = /v1/chat/completions { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <clave-upstream>"; proxy_pass http://127.0.0.1:8000; proxy_buffering off; # para respuestas en streaming } location = /v1/models { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <clave-upstream>"; proxy_pass http://127.0.0.1:8000; } location = /_auth { internal; proxy_pass http://127.0.0.1:4180/oauth2/auth; # integración con el IdP interno, p. ej. con oauth2-proxy } location / { return 404; } # no exponer /metrics, /invocations, etc. }Los usuarios se identifican con el SSO de la empresa (OIDC o SAML) y la clave de la API upstream no se reparte.
auth_requestes un módulo de nginx; puedes comprobar si está incluido connginx -V. -
Bloquear el tráfico saliente
Servidor en red aisladaBloquea por defecto todo el tráfico del servidor hacia internet. Solo se permiten el DNS interno, la sincronización horaria y el destino de los logs.
bash · ufwsudo ufw default deny incoming sudo ufw default deny outgoing sudo ufw allow in on <IF-gestión> to any port 22 proto tcp # si no se permite antes, se corta el SSH sudo ufw allow in on <IF-interna> to any port 443 proto tcp sudo ufw allow out to <DNS-interno> port 53 proto udp sudo ufw allow out to <NTP-interno> port 123 proto udp sudo ufw allow out to <colector-de-logs> port 514 proto tcp sudo ufw enable # Comprobar que no se puede salir (si falla, está bien) curl -m 5 https://huggingface.coSi publicas un puerto con
-pde Docker, Docker añade sus propias reglas de paquetes, y puede ser accesible desde fuera aunque creas haberlo cerrado con ufw. En estos pasos se usan--network hosty--host 127.0.0.1para limitar la escucha al equipo local.bash · si usas -p# Publicar en el host solo en 127.0.0.1 (-p 8000:8000 publica en todas las interfaces) sudo docker run -d --name qwen --gpus all --ipc=host \ -p 127.0.0.1:8000:8000 \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 --served-model-name qwen3.8-27b \ --host 0.0.0.0 --port 8000 --max-model-len 65536 # ↑ dentro del contenedor escucha en 0.0.0.0; en el host solo sale por 127.0.0.1Así, vLLM escucha en
0.0.0.0dentro del contenedor, pero no es accesible desde fuera del host. Bloquea también el tráfico saliente en el firewall de la red. -
Guardar logs y auditoría
Gateway y monitorizaciónRegistra en los logs de nginx quién usó qué endpoint y cuándo, y envíalos a la plataforma de logs de la empresa (SIEM, etc.). Los tokens se contabilizan con
/metrics(formato Prometheus), expuesto solo en la red de monitorización.nginx · dentro de http { }log_format llm '$time_iso8601 user=$user ip=$remote_addr "$request" ' 'status=$status bytes=$body_bytes_sent rt=$request_time'; access_log /var/log/nginx/llm.log llm;Si activas
--enable-log-requestsen vLLM con nivel DEBUG, el texto de los prompts queda en los logs. Decide si se guarda y durante cuánto tiempo según tus normas de datos personales y confidencialidad. -
Definir usuarios y permisos
Interfaz (Open WebUI, etc.)Si se va a usar como chat, pon una interfaz como Open WebUI en la misma red aislada y separa qué modelos puede usar cada rol y grupo. Haz que las bajas de empleados se bloqueen desde el IdP interno.
env · Open WebUIOFFLINE_MODE=true ENABLE_SIGNUP=false DEFAULT_USER_ROLE=pending ENABLE_COMMUNITY_SHARING=falseCon
OFFLINE_MODEactivado, la búsqueda en documentos (RAG) no funciona si no has instalado antes el modelo de embeddings. El modelo de embeddings también se traslada con el mismo flujo de los pasos 1 a 3. -
Definir el flujo de actualización
Equipo de entrada → validación → producciónvLLM publica versiones cada dos semanas aproximadamente, y casi siempre con correcciones de seguridad. Aun en red aislada, actualiza con regularidad siguiendo el flujo «descarga → validación → registro → producción».
bash# 1. Descargar, comparar y trasladar la versión nueva igual que en los pasos 1 a 3 # 2. En validación, lanzar las mismas preguntas a la versión anterior y a la nueva y comparar # 3. Listar las variables de entorno en uso y comprobar en las notas de versión que no desaparecen sudo docker inspect --format '{{range .Config.Env}}{{println .}}{{end}}' qwen \ | grep -E '^(VLLM_|HF_)' | cut -d= -f1 # 4. Al pasar a producción, dejar una línea con quién subió, cuándo y cuándo se revirtió echo "$(date -I) vllm <versión-anterior>→<versión-nueva> responsable:<nombre> validación:OK rollback:<versión-anterior>.tar" >> /srv/llm/CHANGELOGConserva el contenedor y el modelo de la versión anterior, con su digest anotado, para poder volver atrás. Compara antes y después los valores que cambian entre versiones, como el límite de longitud del contexto.
Seguridad del LLM local: 20 puntos antes de producción
Revísalos en orden, antes y después del montaje. Las casillas solo funcionan en esta pantalla y no se envían a ninguna parte.
0 / 20 comprobados
Descarga de modelos y contenedores
Escucha y tráfico saliente
Entrada y autenticación
Permisos, registros y operación
Errores frecuentes: cuando «creíamos que era seguro»
A la izquierda, el error habitual; a la derecha, la solución con los pasos de esta página.
--host 0.0.0.0sin autenticaciónUsar tal cual el comando de ejemplo y dejarlo abierto a toda la LAN.127.0.0.1+ nginxEscucha solo en local. Los usuarios pasan por el gateway.- Versiones modificadas de origen dudosoUsar GGUF comunitarios, como los «Uncensored», sin comprobar su procedencia.Desde
Qwen/oficial, con SHA fijadoSi usas versiones de terceros, registra autor y proceso. - «Con api-key ya es seguro»Dar por hecho que la clave de vLLM protege todos los endpoints.Filtrar con lista de permitidosPasa solo lo necesario, como
/v1/chat/completions. - «Es on-premise, así que es seguro»Saltarse permisos, logs y control de acceso del RAG porque está dentro de la empresa.Dentro, la misma gestión que fueraSSO, roles, logs y búsqueda que respeta los permisos de lectura.
- Usarlo desde fuera con un túnelPublicar al exterior algo interno con Cloudflare Tunnel u otro.Solo desde la red internaSi hace falta acceso externo, usa el acceso remoto oficial de la empresa.
- No ver el tráfico externo por defectoLas estadísticas de uso de vLLM o la actualización automática de Ollama de escritorio.Con variables de entorno y bloqueo salienteDesactívalo en la configuración y bloquéalo también en el firewall.
- Confiar demasiado en un modelo pequeñoEn agentes o llamadas a herramientas, inventa archivos o enlaces que no existen.Usarlo como primer borradorEjecución en sandbox y resultados revisados por una persona.
- Se rompe al actualizarTras subir de versión, deja de funcionar por variables eliminadas o límites cambiados.Comparar en validaciónContrasta con las notas de versión y anota quién actualizó.
Lo que cuentan los vídeos: casos reales de Qwen autoalojado
Revisamos, hasta la transcripción del audio, 18 vídeos explicativos en inglés, chino y japonés publicados entre febrero y octubre de 2026.
Lo que cuentan los 18 vídeos8 escenas y lo que se ve en conjunto
De lo que se dice: 8 escenas
- Lo que pasó en un banco (de oídas): un ponente cuenta como caso de un banco cliente que «un empleado pasó un archivo con datos personales a una herramienta de IA de su cuenta personal para anonimizarlo; a los 3 minutos llamó Seguridad de la Información, y hubo informe y sanción» (paráfrasis).
Will 保哥 (conferencia) · vídeo, desde 1:39:00 - Lo peligroso es el arnés: en la misma conferencia dice que «en los agentes, lo peligroso no es el modelo sino el arnés (lo que escribe archivos y se comunica). El modelo solo encadena palabras dentro de la GPU» (paráfrasis). Es el motivo del punto 19 de la checklist (sandbox).
Will 保哥 (conferencia) · vídeo, desde 1:21:00 - Por qué fijar la versión: cuenta que «una revisión nueva de la versión cuantizada eliminó las capas MTP y la decodificación especulativa dejó de activarse; por eso se fija el commit» (paráfrasis). De ahí el «fijar la versión» del paso 1.
RepoChad · vídeo, desde 4:05 - El 11434 no tiene clave: explica que «la API de Ollama en
localhost:11434no tiene autenticación por defecto; si se usa en un servidor, hay que controlarla con un proxy inverso o un firewall» (paráfrasis).
Canal japonés sobre software libre · vídeo, desde 10:00 - No abrir el 8000 al mundo: en una prueba con una GPU en la nube dice que «no quiere abrir el puerto 8000 al mundo, así que se conecta con reenvío de puertos SSH» (paráfrasis). Es la alternativa en fase de pruebas, antes de tener TLS.
The Cef Experience · vídeo, desde 9:31 - Aun on-premise, se ve demasiado: advierte que «si se descuida el diseño de permisos, la IA llega a responder con datos de nóminas o de personal que no deberían verse. Tenerla dentro de la empresa no basta para que sea segura» (paráfrasis).
Canal japonés sobre gestión · vídeo, desde 24:30 - Una línea por actualización: recomienda «fijar la versión actual, dejar una etiqueta y anotar en una línea quién actualizó, cuándo y cuándo se revirtió; ayuda mucho ante una incidencia» (paráfrasis). Es el formato de registro del paso 9.
Canal japonés de noticias de IA · vídeo, desde 7:01 - El tiempo también cuesta: tras dos días probando con Ollama y un túnel antes de volver a la nube, concluye que «lo gratis tiene costes ocultos; el tiempo también es un coste» (paráfrasis).
Garfield_Investment · vídeo, desde 8:02
Hay vídeos que muestran cómo saltarse la activación de software comercial con modelos modificados no oficiales; no lo imites. Esta página no usa versiones modificadas de origen dudoso.
Lo que se ve en los 18 vídeos
- Secreto profesional: un asesor fiscal montó una IA tributaria con un Mac, Ollama, Qwen3 y Open WebUI que funciona aun sin Wi-Fi. También dice que los cálculos de impuestos en varios pasos son difíciles y que, hoy por hoy, lo mejor es usar la nube con el consentimiento del cliente.
- Air gap: cuatro fases: replicar las herramientas, trasladar físicamente el modelo y arrancar el motor de inferencia desde el almacenamiento interno de la red aislada. También se colocan evaluación y gateway.
- Qué motor para qué: llama.cpp para una persona, vLLM para muchas, SGLang para agentes que reutilizan las mismas instrucciones largas. También se defiende Linux antes que Windows para producción.
- Dos GPU no son una GPU grande: varios explican que la comunicación entre tarjetas es el cuello de botella y que la velocidad para una persona apenas cambia. Lo que aumenta es la concurrencia y la longitud del contexto.
- La espera con contextos largos: en un caso con Qwen3.8-27B sobre dos GPU de 16 GB, una entrada de ~250 000 tokens tardó más de 4 minutos en dar el primer carácter.
Las declaraciones son paráfrasis a partir de transcripciones automáticas del audio, no citas literales. Los tiempos son aproximados; a veces lo dicho aparece unos 30 segundos después del enlace. Las cifras son un ejemplo en cada configuración.
SIMY y Qwen: dentro de la red, Qwen; fuera, SIMY
Seamos claros: hoy SIMY no funciona con Qwen, ni dentro de una red aislada ni sin conexión.
- TranscripciónReunión confidencial
- ResumenEn la GPU interna
- BorradorEl texto no sale
- Lo autorizadoResponsables, plazos, fechas
- Responsables y plazosRecogidos de la reunión
- RespuestaBorrador en Gmail
- DecisiónSolo vuelve una pregunta
* Reparto de ejemplo con fines ilustrativos
- Lo recoge de reuniones y chats
- A tu manera
- Solo te devuelve decisiones
El texto confidencial, en el Qwen de la red aislada. Después, de «quién hace qué y para cuándo», SIMY avanza la parte que la empresa ha decidido que puede salir, dentro de las herramientas que la empresa autoriza.
- Cómo funciona SIMY: la ejecución en la nube funciona con tu cuenta de ChatGPT (Codex). El uso de Codex entra dentro de tu plan de ChatGPT.
- Ejecución en el PC: la app de escritorio de SIMY puede usar Claude Code de tu PC para ejecutar el trabajo. Descárgala aquí.
- Lectura del historial de conversaciones: la app de escritorio lee el historial de Claude Code y Codex y convierte el trabajo que repites en «Sugerencias de SIMY». El texto de las conversaciones no se guarda en el servidor. Decide en tu normativa interna en qué PC y con qué alcance se usa.
Dónde trazar la línea: qué información se queda en la red aislada y qué puede tratarse con herramientas externas lo decide la normativa de tu empresa. Cómo trata SIMY los datos está publicado en Seguridad y en la Política de privacidad.
Preguntas frecuentes sobre LLM local y Qwen
¿Qué es un LLM local?
Es ejecutar los pesos publicados de un modelo en tu propio PC o en un servidor de la empresa. Como el texto que introduces no sale de esa máquina, también sirve para documentos confidenciales.
¿Qué se puede hacer con un LLM local?
Resumir y redactar documentos confidenciales, responder preguntas sobre documentos internos (RAG), traducir y ayudar con código. Los modelos pequeños sirven más para un «primer borrador» que para la versión final.
¿Qué LLM local recomiendan?
Para probar, Qwen3 de 4B a 8B; para un departamento, Qwen3-14B o 32B o Qwen3.8-27B; para código, Qwen3-Coder (octubre de 2026). Antes de comprar una GPU grande, comprueba con tu PC si sirve como «primer borrador».
¿Qwen es gratis si se ejecuta en local?
Los modelos Apache 2.0 no tienen coste de uso y admiten uso comercial. Pero la GPU, el servidor, la electricidad y el trabajo de operación corren por tu cuenta, y algunos modelos tienen licencia propia.
¿Qué requisitos hacen falta para ejecutar Qwen en local?
Según las cifras oficiales de Qwen, Qwen3-8B usa unos 16 GB de memoria de GPU en BF16 y Qwen3-32B unos 33 GB en FP8. Son valores centrados en los pesos; la caché KV aumenta en proporción a los usuarios simultáneos y a la longitud del contexto.
¿Qwen3.8-27B funciona con una sola RTX 5090?
La versión cuantizada a 4 bits cabe en una RTX 5090 de 32 GB. En BF16 solo los pesos ocupan ~54 GB (estimación calculada), así que no cabe, y la versión FP8 ocupa ~29 GB solo en pesos, por lo que no entra sin bajar mucho el límite de contexto.
¿Qué diferencia hay entre Ollama y vLLM?
Ollama es para probar con facilidad; vLLM, para producción con muchos usuarios a la vez. Ollama escucha por defecto solo en 127.0.0.1, pero vLLM escucha en todas las interfaces si se omite --host, así que hay que indicarlo siempre.
¿Hace falta actualizar en una red aislada?
Sí. vLLM publica versiones cada dos semanas aproximadamente, casi siempre con correcciones de seguridad. Define un flujo: descargar en el equipo de entrada, comparar en validación y luego pasar a producción.
¿Qwen se puede usar comercialmente?
Los modelos Apache 2.0 (Qwen3, Qwen3.8-27B, etc.) admiten uso comercial. Qwen2.5-3B, 72B o Qwen3.8-Flash-Next, entre otros, tienen otra licencia, así que revisa con legal el LICENSE del modelo que vayas a usar.
¿Qwen funciona en español?
Sí. En el anuncio de la generación Qwen3 se mencionan 119 idiomas y dialectos, entre ellos el español. Los modelos pequeños pueden sonar poco naturales en textos largos, así que revisa los textos importantes antes de usarlos.
¿Qwen funciona en Mac?
Sí. Ollama, LM Studio y llama.cpp funcionan en Mac. En Apple Silicon la memoria se comparte con la GPU, así que necesitas bastante más memoria que el tamaño del archivo del modelo.
¿On-premise ya es seguro?
Por sí solo, no. Solo cuando has definido dónde escucha, la autenticación, el tráfico saliente, los logs y los permisos de lectura de los documentos internos puedes demostrar que nada sale.
¿SIMY se puede usar en una red aislada?
No. Hoy SIMY no funciona dentro de una red aislada ni sin conexión, y tampoco con Qwen. Se puede repartir así: el texto confidencial, en el Qwen de la red aislada, y la organización del trabajo que la empresa autorice, con SIMY.
Fuentes
Los pasos, la configuración por defecto y las licencias se verificaron en estas fuentes oficiales (fecha de verificación: 1 de octubre de 2026). Las versiones y los valores por defecto cambian a menudo, así que consulta cada página oficial antes de montar nada.
- Security (documentación de vLLM), Usage Stats Collection, vllm serve
- Notas de versión de vLLM (GitHub)
- Server Arguments (documentación de SGLang)
- FAQ (documentación de Ollama)
- README de llama.cpp server (GitHub)
- Despliegue con vLLM (documentación de Qwen), Speed Benchmark (documentación de Qwen)
- Qwen (Hugging Face), ficha del modelo Qwen3.8-27B
- Hugging Face CLI, Variables de entorno (Hugging Face Hub)
- ngx_http_auth_request_module (documentación de nginx), ngx_http_ssl_module
- Environment Variable Configuration (documentación de Open WebUI)
- Packet filtering and firewalls (documentación de Docker)
- qwen3.8 (biblioteca de Ollama)