目录
不能贴进外部 AI 的机密,你是否也这样
明知道用 AI 会更快,可这些对话不能传到公司外面。
把文件交给个人订阅的 AI 做匿名化,信息安全部门随即找上门,最后要写检讨报告。
法务一句“不能发给外部 AI”就叫停了。明知道好用,却推进不了。
用 Ollama 试成功了,可谁能连上它,说不清楚。
不能外传,所以干脆不用 AI。在这两个极端之间,还有“部署在自己的服务器上”这条路。
※ 1 和 2 是根据讲解视频中介绍的案例改编的示例(视频里讲了什么)。
其实你想要的是:机密不出门,交给内部的 Qwen
同样的资料、同样的会议。交给 AI 处理,数据也不离开公司。
数据不离开公司内部的服务器,不必再贴进外部的 AI。
监听地址、认证、出站通信、日志。在哪里拦住,一目了然。
获取、验证、台账、上线。流程固定,谁来做都一样。
“要不要升到这个版本”。前后对比已经备齐,只需决定这一个问题。
以上这些,用本页的步骤和检查清单就能搭起来。连同会后安排在内的分工方式,整理在与 SIMY 的关系中。
本地 LLM 是什么:为什么在公司内部运行 Qwen
本地 LLM,是把公开的模型权重放在自己的电脑或公司内部服务器上运行的用法。输入的文字不会离开这台机器。
| 叫法 | 在哪里运行 | 适合的场景 |
|---|---|---|
| 本地 LLM | 自己的电脑(Mac 或 Windows) | 一个人试用、离线使用 |
| 本地化部署、私有化部署的 LLM | 公司内部的服务器或数据中心 | 部门或全公司同时使用 |
| 内网(封闭网络)中的 LLM | 不连接互联网的网络内部 | 涉及保密义务、个人信息、设计信息 |
本地 LLM 能做什么
- 机密文件的摘要与起草:会议纪要、合同、设计文档、与客户的往来。
- 内部文档检索与问答(RAG):让模型读取公司的规章和操作手册,回答提问。
- 翻译与代码辅助:中、英、日互译,解释公司内部代码、给出修改建议。
小模型不如云端的大模型聪明。把它当作写“初稿”的角色而不是定稿,就不容易和预期产生落差。
选择 Qwen 的理由
- 有 Apache 2.0 的模型
- 中文、日语等多语言
- 尺寸可选
- 许可证:Qwen3、Qwen3.8-27B 等许多模型以 Apache 2.0 发布。但并非全部如此(见下表)。
- 语言:Qwen3 一代发布时宣称支持包括中文、日语在内的 119 种语言和方言。
- 尺寸:从能在电脑上运行的 0.6B~8B,到量化后可放进一张 GPU 的 27B~32B,再到需要多张 GPU 的 235B。
许可证因模型而异
表格可以横向滚动 →
| 模型 | 许可证 | 确认程度 |
|---|---|---|
| Qwen3(0.6B~32B、30B-A3B、235B-A22B-2507)、Qwen3-VL、Qwen3-Coder、Qwen3-Embedding、Reranker | Apache 2.0 | 已在 Hugging Face 确认 |
| Qwen3.5(0.8B~35B-A3B)、Qwen3.6(27B、35B-A3B)、Qwen3.8-27B(含 FP8 版) | Apache 2.0 | 已在 Hugging Face 确认 |
| Qwen2.5 的大部分(0.5B~32B、Coder 7B、14B、VL-7B) | Apache 2.0 | 已在 Hugging Face 确认 |
| Qwen2.5-3B、Qwen2.5-VL-3B | qwen-research(研究用途。商用另有规定) | 仅确认名称。条款需核实 |
| Qwen2.5-72B-Instruct、Qwen2.5-VL-72B | qwen(自有许可证) | 仅确认名称。条件需核实 |
| Qwen3.8-2.4T-A95B | 自有许可证 | 已在 Hugging Face 确认 |
| Qwen3.8-Flash-Next | qwen-community-1.0。据称作为 MaaS 提供,或用于编程、办公辅助等“AI work assistant”用途时,需要另行取得许可 | 依据摘要确认。须经法务确认 |
2026 年 10 月 1 日依据 Hugging Face 上 Qwen 组织的模型信息确认。并不是“只要是 Qwen 就都是 Apache 2.0”。商用之前,请与法务一起确认所用模型仓库中的 LICENSE。
本地 LLM 推荐:按用途选择 Qwen截至 2026 年 10 月。拿不准时先从小的开始
- 先在电脑上试:Qwen3 的 4B~8B,或 Qwen3.5 的小模型。可以用 Ollama 或 LM Studio 运行,确认它对业务是否有用。
- 部门用的摘要和起草:Qwen3-14B、32B,或 Qwen3.8-27B。FP8 或 4bit 版本的大小可以放进一张 GPU,能处理图像的是 3.8-27B。
- 代码辅助:Qwen3-Coder(30B-A3B)。激活参数少的 MoE 架构,以它的规模来说运行很快。
- 内部文档检索:在作答模型之外,再搭配 Qwen3-Embedding 和 Reranker。
先把用途定成一个再去试,更容易判断多大的模型就够用。与其一上来就买大显卡,不如先用手头的电脑确认“能不能当初稿用”,这是捷径。
Qwen 本身的用法(Qwen Chat、API、主要模型)见Qwen 使用指南,与其他中国模型的比较见中国 AI(LLM)对比。
推理引擎怎么选:Ollama、llama.cpp、vLLM、SGLang、LM Studio
运行模型的软件就是“推理引擎”。从安全角度看,最大的区别在于:什么都不设置时,它在哪里监听。
表格可以横向滚动 →
| 引擎 | 默认监听 | 自带认证 | TLS | 对外通信 | 适合的用途 |
|---|---|---|---|---|---|
| Ollama | 127.0.0.1:11434 | 官方 FAQ 未提及。由代理负责 | 无。在代理处终止 | 云功能可用OLLAMA_NO_CLOUD=1关闭。Mac、Windows 版会自动检查更新 | 个人或小团队试用、Mac |
| llama.cpp(llama-server) | 127.0.0.1:8080 | --api-key、--api-key-file | --ssl-key-file、--ssl-cert-file | 用--offline停止网络检查 | 单人使用、GGUF、CPU、Apple、AMD |
| vLLM | 省略--host时监听所有网卡(端口 8000) | --api-key或VLLM_API_KEY。只保护/v1等部分端点 | --ssl-keyfile、--ssl-certfile | 默认发送使用统计。用VLLM_NO_USAGE_STATS=1关闭 | 部门或全公司大量并发使用的生产环境 |
| SGLang | 127.0.0.1:30000 | --api-key。管理用为--admin-api-key | 在代理处终止较稳妥 | 用HF_HUB_OFFLINE=1停止下载模型 | 智能体用途、反复使用同一段长提示词 |
| LM Studio | 仅本机(端口 1234)。可在设置中切换为向局域网开放 | 以官方文档为准 | 无 | 以官方文档为准 | 在界面中试用、Mac 或个人电脑 |
依据 2026 年 10 月各官方文档(vLLM 还查看了源码)确认。LM Studio 一行中未能完全确认的项目标为“以官方文档为准”。
- 先验证:用 llama.cpp 或 Ollama 看看对业务是否有用。
- 全公司使用:vLLM。即使很多人同时使用,速度也不容易下降。
- 智能体大量发送同一段长指令:SGLang。
vLLM 的注意事项:官方的 Security 页面说明,--api-key只保护/v1等端点,/invocations、/pooling等不在保护范围内。正因如此,官方也把“放在只放行需公开端点的反向代理之后”视为最有效的对策。
硬件参考:各 Qwen 模型所需的显存
所需显存,可以看作三项相加。
- 权重参数量 × 每个参数的字节数(BF16 为 2,FP8 为 1,4bit 约 0.5)
- + KV 缓存与上下文长度 × 同时使用人数成正比
- + 余量运行时的工作空间
表格可以横向滚动 →
| 模型 | BF16 | FP8 | 4bit(INT4 等) | 来源 |
|---|---|---|---|---|
| Qwen3-8B | 约 16GB | 约 9.3GB | 约 6.2GB | Qwen 官方速度基准测试 |
| Qwen3-14B | 约 28GB | 约 16GB | 约 10GB | 同上 |
| Qwen3-32B | 约 63GB | 约 33GB | 约 19GB | 同上 |
| Qwen3-235B-A22B | GPU 8 张 | GPU 4 张 | GPU 4 张(GPTQ-INT4) | 同上(SGLang 配置) |
| Qwen3.8-27B | 约 54GB(仅权重,估算值) | 约 27GB(估算)。官方 FP8 版有约 28.8GB 的实测例 | 约 14GB(估算)。实际文件约 17~18GB(Ollama 版下载约 18GB) | 按参数量估算、实测例、Ollama 模型库 |
Qwen3 的数值来自 Qwen 官方速度基准测试(用 transformers 处理短输入、刚启动时的显存)。Qwen3.8-27B 没有官方数值表,因此是按参数量估算的参考值和个人实测例,不含 KV 缓存。所需显存会因量化版本和上下文长度而大幅变化(截至 2026 年 10 月)。
- Qwen3.8-27B 与 32GB 显卡:BF16 仅权重就约 54GB(估算值),一张 RTX 5090(32GB)放不下。官方 FP8 版仅权重也有约 28.8GB,有估算指出上下文拉满时 32GB 装不下。可以改用 4bit 版本,或降低上下文上限来调整。
- 两张 16GB 显卡不等于一张 32GB:拆到两张卡上,会因卡间通信和每张卡各自需要的工作空间而吃亏。
- 长上下文会拉长等待时间:某个人实测例中,约 25 万 token 的输入,等到第一个字输出用了 4 分钟以上。
- Mac:Apple 芯片的内存与 GPU 共享。需要比模型文件大得多的内存。
如何确定规模:请先确定同时使用的人数,以及一次要读入的文档长度。KV 缓存会与这两者成比例增长,只按权重估算的话,上线后就会不够用。
内网搭建步骤:把 Qwen+vLLM 部署到公司服务器
示例使用 Qwen3.8-27B 的 FP8 版、vLLM(Docker)和 Linux 服务器。命令按 2026 年 10 月的官方文档编写。显存不足时,可降低上下文上限(--max-model-len),或选择 4bit 版本。
※ 架构仅为说明用的示意图
命令的读法:像<已确认的提交SHA>这样用尖括号括起来的部分,请替换成贵公司的值。版本号是 2026 年 10 月的示例。
-
固定版本并获取模型
摆渡机(联网侧)从官方
Qwen/组织的仓库,指定提交获取。推理引擎的容器也固定版本后保存。bashpip install -U huggingface_hub hf download Qwen/Qwen3.8-27B-FP8 \ --revision <已确认的提交SHA> \ --local-dir ./Qwen3.8-27B-FP8 docker pull vllm/vllm-openai:v0.30.0 docker inspect --format '{{index .RepoDigests 0}}' vllm/vllm-openai:v0.30.0 docker save vllm/vllm-openai:v0.30.0 -o vllm-openai-v0.30.0.tar把
docker inspect显示的摘要值(以sha256:开头)抄进台账。固定版本的理由:即使是同一个仓库,新的修订版内容也可能改变。有案例提到,某个量化版的新修订删掉了用于投机解码的层(MTP),导致加速无法启用。
-
建立 SHA-256 台账
摆渡机Hugging Face API 返回的
lfs.oid,就是大文件(LFS)的 SHA-256。用它与手头的文件核对。bash# 取出 Hugging Face 端的值(仅 LFS 文件) curl -s "https://huggingface.co/api/models/Qwen/Qwen3.8-27B-FP8/tree/<已确认的提交SHA>?recursive=true&expand=true" \ | jq -r '.[] | select(.lfs) | "\(.lfs.oid) ./\(.path)"' > HF.sha256 # 与手头的文件核对,并生成全部文件的台账 cd Qwen3.8-27B-FP8 sha256sum -c ../HF.sha256 find . -type f ! -path './.cache/*' -print0 | sort -z | xargs -0 sha256sum > ../MODEL.sha256 cd .. && sha256sum vllm-openai-v0.30.0.tar > IMAGE.sha256台账由获取者以外的另一位负责人确认并签署(签署方式按公司内部标准)。
-
通过介质带入,加载前先验证
内网服务器用介质转移台账和文件,在内网一侧再核对一次。只要出现一行
FAILED就不使用。bashcd /srv/llm/models/Qwen3.8-27B-FP8 && sha256sum -c /srv/llm/incoming/MODEL.sha256 cd /srv/llm/incoming && sha256sum -c IMAGE.sha256 docker load -i vllm-openai-v0.30.0.tar -
启动时只在 127.0.0.1 监听
内网服务器vLLM 省略
--host时会在所有网卡上监听。务必写上--host 127.0.0.1,密钥用文件传入(写在命令行里会被ps看到)。bash · vLLM(Docker)# 创建密钥文件,权限设为 600 sudo install -D -m 600 /dev/null /etc/llm/vllm.env echo "VLLM_API_KEY=$(openssl rand -hex 32)" | sudo tee /etc/llm/vllm.env > /dev/null sudo docker run -d --name qwen --gpus all --ipc=host --network host \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 \ --served-model-name qwen3.8-27b \ --host 127.0.0.1 --port 8000 \ --max-model-len 65536 --gpu-memory-utilization 0.90 # 确认只在 127.0.0.1:8000 监听 ss -ltnp | grep 8000- 不要加
--trust-remote-code。这样就不会执行模型附带的代码。 - 生产环境不要用
VLLM_SERVER_DEV_MODE=1。它会公开开发用的端点。 - 思考模式与工具调用:Qwen 官方文档以 Qwen3 为例,给出了
--reasoning-parser qwen3和--enable-auto-tool-choice --tool-call-parser hermes。3.8 一代的参数请以模型卡为准。
bash · Ollama(systemd)sudo systemctl edit ollama # 在打开的文件中写入以下 3 行并保存 [Service] Environment="OLLAMA_HOST=127.0.0.1:11434" Environment="OLLAMA_NO_CLOUD=1" sudo systemctl restart ollamabash · SGLang、llama.cpppython3 -m sglang.launch_server --model-path /models/Qwen3.8-27B-FP8 \ --host 127.0.0.1 --port 30000 --api-key <密钥> --admin-api-key <管理用密钥> llama-server -m /models/qwen.gguf --host 127.0.0.1 --port 8080 \ --api-key-file /etc/llm/keys --offline --no-webui --jinjaSGLang 的示例中,实际也不要直接写入密钥,请从文件或环境变量传入。模型卡里的示例是
--host 0.0.0.0,请不要原样复制。 - 不要加
-
用 nginx 加上 TLS、白名单和认证
内网服务器(网关)让用户只能接触到 nginx。只放行
/v1中需要的部分,其余一律返回 404。nginxserver { listen 443 ssl; server_name llm.internal.example; ssl_certificate /etc/pki/llm.crt; ssl_certificate_key /etc/pki/llm.key; ssl_protocols TLSv1.2 TLSv1.3; allow 10.20.0.0/16; # 仅限公司内网段 deny all; location = /v1/chat/completions { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <上游密钥>"; proxy_pass http://127.0.0.1:8000; proxy_buffering off; # 用于流式响应 } location = /v1/models { auth_request /_auth; auth_request_set $user $upstream_http_x_auth_request_user; proxy_set_header Authorization "Bearer <上游密钥>"; proxy_pass http://127.0.0.1:8000; } location = /_auth { internal; proxy_pass http://127.0.0.1:4180/oauth2/auth; # 通过 oauth2-proxy 等对接公司的 IdP } location / { return 404; } # 不暴露 /metrics、/invocations 等 }用户通过公司的 SSO(OIDC 或 SAML)验证身份,上游的 API 密钥不分发给用户。
auth_request是 nginx 的模块,可以用nginx -V确认构建中是否包含它。 -
拒绝出站通信
内网服务器服务器访问互联网的通信,默认全部拒绝。只放行公司内部的 DNS、时间同步和日志收集端。
bash · ufwsudo ufw default deny incoming sudo ufw default deny outgoing sudo ufw allow in on <管理网卡> to any port 22 proto tcp # 不先放行的话 SSH 会断开 sudo ufw allow in on <内网网卡> to any port 443 proto tcp sudo ufw allow out to <内网DNS> port 53 proto udp sudo ufw allow out to <内网NTP> port 123 proto udp sudo ufw allow out to <日志收集端> port 514 proto tcp sudo ufw enable # 确认无法访问外网(失败才是正确的) curl -m 5 https://huggingface.co用 Docker 的
-p公开端口时,Docker 会自行添加数据包规则,即使以为已经用 ufw 关上了,外部也可能访问得到。本步骤使用--network host和--host 127.0.0.1,把监听限制在本机。bash · 使用 -p 时# 主机侧只对 127.0.0.1 公开(-p 8000:8000 会对所有网卡公开) sudo docker run -d --name qwen --gpus all --ipc=host \ -p 127.0.0.1:8000:8000 \ -v /srv/llm/models:/models:ro \ -e HF_HUB_OFFLINE=1 -e VLLM_NO_USAGE_STATS=1 -e DO_NOT_TRACK=1 \ --env-file /etc/llm/vllm.env \ vllm/vllm-openai:v0.30.0 \ --model /models/Qwen3.8-27B-FP8 --served-model-name qwen3.8-27b \ --host 0.0.0.0 --port 8000 --max-model-len 65536 # ↑ 容器内在 0.0.0.0 监听,主机侧只对 127.0.0.1 开放这种方式下,容器内的 vLLM 在
0.0.0.0监听,但从主机外部无法访问。在网络侧的防火墙上,也请阻断出站通信。 -
保留日志与审计记录
网关、监控把谁、何时、用了哪个端点记录在 nginx 日志里,发送到公司的日志平台(SIEM 等)。token 数量通过只对监控网络开放的
/metrics(Prometheus 格式)汇总。nginx · http { } 内log_format llm '$time_iso8601 user=$user ip=$remote_addr "$request" ' 'status=$status bytes=$body_bytes_sent rt=$request_time'; access_log /var/log/nginx/llm.log llm;在 vLLM 中启用
--enable-log-requests并设为 DEBUG 级别时,提示词正文会留在日志里。是否保留正文以及保存期限,请按个人信息和机密相关的规章来定。 -
确定用户与权限
界面(Open WebUI 等)如果要在界面上以聊天方式使用,就把 Open WebUI 等前端放在同一个内网里,按角色和用户组划分可用的模型。离职人员要能在公司的 IdP 中被停用。
env · Open WebUIOFFLINE_MODE=true ENABLE_SIGNUP=false DEFAULT_USER_ROLE=pending ENABLE_COMMUNITY_SHARING=false启用
OFFLINE_MODE后,如果没有事先放入嵌入模型,文档检索(RAG)将无法工作。嵌入模型也按步骤 1~3 的同样流程带入。 -
事先定好更新流程
摆渡机 → 测试环境 → 生产环境vLLM 大约每两周发布一次,几乎每次都包含安全修复。即使在内网,也请按“获取 → 验证 → 台账 → 上线”的流程定期升级。
bash# 1. 新版本按步骤 1~3 同样获取、核对、带入 # 2. 在测试环境中,向旧版和新版提出同样的问题进行对比 # 3. 列出正在使用的环境变量名,对照发布说明确认新版本中没有被删除 sudo docker inspect --format '{{range .Config.Env}}{{println .}}{{end}}' qwen \ | grep -E '^(VLLM_|HF_)' | cut -d= -f1 # 4. 上线生产后,用一行记下谁在何时升级、何时回滚 echo "$(date -I) vllm <旧版本>→<新版本> 负责人:<姓名> 验证:OK 回滚:<旧版本>.tar" >> /srv/llm/CHANGELOG上一版本的容器和模型要记下摘要值并保留,以便回滚。上下文长度上限等随版本变化的值,请在升级前后对比。
本地 LLM 安全检查清单:上线前的 20 项
请在搭建前后从上到下逐项确认。勾选只在本页面内有效,不会发送到任何地方。
0 / 20 已确认
获取模型与容器
监听与对外通信
入口与认证
权限、记录与运维
常见错误:本地 LLM 的“我以为”留下的漏洞
左边是常见的错误,右边是按本页步骤的对策。
--host 0.0.0.0且不设认证直接照搬示例启动命令,结果对整个局域网公开。127.0.0.1+nginx只在本机监听,用户经由网关访问。- 来路不明的改版模型不查来源就用“Uncensored”之类的社区版 GGUF。从官方
Qwen/获取,固定 SHA使用第三方版本时,记录作者和制作步骤。 - “加了 api-key 就安全了”以为 vLLM 的密钥能保护所有端点。用白名单收窄只放行
/v1/chat/completions等必要的端点。 - “本地化部署所以安全”因为放在公司内部,就省掉了权限、日志和 RAG 的访问控制。内部也要按对外的标准管理SSO、角色、日志,以及继承查阅权限的检索。
- 用隧道从外部访问明明是内部用途,却用 Cloudflare Tunnel 等对外公开。只允许从公司内网访问确需从外部使用时,走公司正规的远程接入。
- 没注意到默认的对外通信vLLM 的使用统计、Ollama 桌面版的自动更新。环境变量和拒绝出站双管齐下在设置里关掉,也在防火墙上拦住。
- 过度依赖小模型在智能体或工具调用中,它会编造不存在的文件或链接。当作初稿使用在沙箱中执行,结果由人来确认。
- 一更新就出故障升级版本后,因环境变量被删、上限变更而无法运行。在测试环境中做前后对比对照发布说明,并记录是谁升级的。
视频里讲了什么:Qwen 自托管的实际案例
我们查看了 2026 年 2~10 月发布的英语、中文、日语讲解视频共 18 个,连语音转写稿都逐一核对过。
18 个视频里讲了什么8 个场景,以及从整体看到的要点
来自发言:8 个场景
- 银行里发生的事(转述):演讲嘉宾讲了客户银行里的一个例子:员工把含个人信息的文件交给自己个人订阅的 AI 工具做匿名化,3 分钟后信息安全部门就打来电话,最后写了报告并受到处分(大意)。
Will 保哥(演讲)、视频 1:39:00 起 - 危险的是外围框架:同一场演讲中提到:“智能体里危险的不是模型,而是外围框架(负责写文件、做通信的那套机制)。模型只是在 GPU 里把字接起来而已”(大意)。这就是检查清单第 19 项(沙箱)的理由。
Will 保哥(演讲)、视频 1:21:00 起 - 固定版本的理由:提到“量化版的新修订删掉了 MTP 层,投机解码就启用不了了。所以要用提交来固定”(大意)。步骤 1 的“固定版本”就是为此。
RepoChad、视频 4:05 起 - 11434 端口没有锁:提到“Ollama 的
localhost:11434API 默认没有认证。在服务器上使用时,要用反向代理或防火墙来控制”(大意)。
Satsuki 的 OSS 研究室(日语频道)、视频 10:00 起 - 不把 8000 端口向全世界开放:在云端 GPU 上试用的例子中提到:“不想把 8000 端口向全世界开放,所以用 SSH 端口转发来连接”(大意)。这是准备好 TLS 之前、验证阶段的替代做法。
The Cef Experience、视频 9:31 起 - 本地化部署也会看得太多:提到“权限设计做不好,AI 就会把本不该看到的工资和人事信息都答出来。光放在公司内部并不安全”(大意)。
管理专家(日语频道)、视频 24:30 起 - 更新记录只要一行:提到“固定当前版本并打上标签,用一行记下谁在何时升级、何时回滚。出故障时很管用”(大意)。这就是步骤 9 的记录形式。
AI 新闻(日语频道)、视频 7:01 起 - 时间也是成本:根据用 Ollama 和隧道试了两天、最后回到云端的经历,提到“免费有隐藏成本,时间也是成本”(大意)。
Garfield_Investment、视频 8:02 起
也有视频用非官方的改版模型演示绕过商业软件的授权验证,请不要模仿。来路不明的改版模型,在本页的步骤中一律不用。
从 18 个视频整体看到的
- 保密义务:一位税务师用一台 Mac 加 Ollama、Qwen3、Open WebUI,做出了断开 Wi-Fi 也能运行的税务 AI。他也提到,多步骤的税额计算仍然困难,目前最好的做法是在征得客户同意后使用云端。
- 物理隔离(Air Gap):镜像工具、物理带入模型、从内网存储启动推理引擎,共四个阶段。还要配置评测和网关。
- 引擎的分工:单人用 llama.cpp,多人用 vLLM,反复使用同一段长指令的智能体用 SGLang。也有人主张生产环境用 Linux 而不是 Windows。
- 两张 GPU 不会变成一张大 GPU:卡间通信会成为瓶颈,单人使用的速度没有太大变化。能增加的是并发连接数和上下文长度,好几个视频都这样解释。
- 长上下文的等待时间:用两张 16GB 显卡运行 Qwen3.8-27B 的例子中,约 25 万 token 的输入,等到第一个字用了 4 分钟以上。
发言内容是根据语音自动转写稿整理的大意,并非逐字引用。时间点仅供参考,有时会在链接位置之后约 30 秒才讲到。数值均为各自配置下的一个例子。
与 SIMY 的关系:内网里用 Qwen,外面用 SIMY
坦白说:SIMY 目前不能用 Qwen 运行,也无法在内网或离线环境中运行。
- 转写机密会议
- 摘要在公司内的 GPU 上
- 起草正文不外传
- 允许的范围负责人、截止日期、日程
- 负责人与截止日期从会议中提取
- 回复在 Gmail 中存为草稿
- 判断只回来一个问题
※ 分工仅为说明用的示意图
- 从会议和聊天中提取
- 按你的做法
- 只交还判断
机密正文,由内网的 Qwen 处理。之后,“谁、在什么时候之前、做什么”中公司决定可以对外的部分,由 SIMY 在公司允许的工具中推进。
- SIMY 的运行方式:云端执行使用你的 ChatGPT 账户(Codex)运行。Codex 的使用量在你的 ChatGPT 方案范围内。
- 在电脑上执行:SIMY 桌面应用可以让电脑上的 Claude Code 担任执行者。点此下载。
- 读取对话记录:桌面应用会读取 Claude Code 和 Codex 的对话记录,把你反复在做的工作变成“来自 SIMY 的建议”。对话正文不保存在服务器上。使用哪台电脑、读取哪些范围,请按公司规章决定。
界线怎么划:哪些信息留在内网、从哪里开始可以交给外部工具处理,由公司规章决定。SIMY 的数据处理方式已在安全和隐私政策中公开。
本地 LLM 与 Qwen 常见问题
本地 LLM 是什么?
把公开的模型权重放在自己的电脑或公司内部服务器上运行的用法。输入的文字不会离开这台机器,因此也能处理公司机密文件。
本地 LLM 能做什么?
可以为机密文件做摘要和起草、读取内部文档后回答问题(RAG),以及辅助翻译和编写代码。小模型更适合做“初稿”,而不是定稿。
本地 LLM 推荐哪一款?
先试用推荐 Qwen3 的 4B~8B,部门使用推荐 Qwen3-14B、32B 或 Qwen3.8-27B,写代码推荐 Qwen3-Coder(截至 2026 年 10 月)。在购买大显卡之前,先用手头的电脑确认它能否胜任“初稿”。
在本地运行 Qwen 是免费的吗?
Apache 2.0 许可的模型不收使用费,也可以商用。但 GPU、服务器、电费和运维工作要由公司自己承担,而且部分模型使用自有许可证。
在本地运行 Qwen 需要什么配置?
按 Qwen 官方数据,Qwen3-8B 在 BF16 下约占 16GB 显存,Qwen3-32B 在 FP8 下约占 33GB。这些数值以权重为主,KV 缓存会随同时使用的人数和上下文长度成比例增加。
Qwen3.8-27B 能在一张 RTX 5090 上运行吗?
4bit 量化版可以放进一张 32GB 的 RTX 5090。BF16 仅权重就约 54GB(估算值),放不下;FP8 版仅权重也有约 29GB,不大幅降低上下文上限就装不下。
Ollama 和 vLLM 有什么区别?
Ollama 用于轻松试用,vLLM 是面向多人同时使用的生产环境的引擎。Ollama 默认只在 127.0.0.1 监听,而 vLLM 省略 --host 时会在所有网卡上监听,务必明确指定。
内网环境也需要更新吗?
需要。vLLM 大约每两周发布一次,几乎每次都包含安全修复。应事先定好流程:用摆渡机获取,在测试环境中对比后再上线生产。
Qwen 可以商用吗?
Apache 2.0 许可的模型(Qwen3、Qwen3.8-27B 等)可以商用。Qwen2.5-3B、72B、Qwen3.8-Flash-Next 等使用其他许可证,请与法务一起确认所用模型的 LICENSE。
Qwen 支持中文和日语等多种语言吗?
支持。Qwen3 一代发布时宣称支持包括中文、日语在内的 119 种语言和方言。小模型处理长文本时可能出现不自然的表达,重要的文字请确认后再用。
Qwen 能在 Mac 上运行吗?
可以。Ollama、LM Studio 和 llama.cpp 都支持 Mac。Apple 芯片的内存与 GPU 共享,需要比模型文件大得多的内存。
做了本地化部署就安全吗?
仅凭这一点还谈不上安全。只有定好监听地址、认证、出站通信、日志和内部文档的访问权限,才能说明数据不会外流。
SIMY 能在内网中使用吗?
不能。目前 SIMY 无法在内网或离线环境中运行,也不能用 Qwen 运行。可以这样分工:机密正文由内网的 Qwen 处理,公司允许范围内的后续安排交给 SIMY 推进。
参考资料
步骤、默认设置和许可证,均依据以下官方信息确认(确认日期:2026 年 10 月 1 日)。版本和默认值经常变化,搭建前请查看各官方页面。
- Security(vLLM 文档)、Usage Stats Collection、vllm serve
- vLLM 发布说明(GitHub)
- Server Arguments(SGLang 文档)
- FAQ(Ollama 文档)
- llama.cpp server README(GitHub)
- 用 vLLM 部署(Qwen 文档)、Speed Benchmark(Qwen 文档)
- Qwen(Hugging Face)、Qwen3.8-27B 模型卡
- Hugging Face CLI、环境变量(Hugging Face Hub)
- ngx_http_auth_request_module(nginx 文档)、ngx_http_ssl_module
- Environment Variable Configuration(Open WebUI 文档)
- Packet filtering and firewalls(Docker 文档)
- qwen3.8(Ollama 模型库)