硬件与软件准备
你需要一台配备 48GB 统一内存的 M4 Pro Mac mini(32GB 也可以跑,但余量更小),以及以下软件:
- oMLX(omlx.app):本地推理服务器,负责加载和提供模型服务
- Tailscale(tailscale.com):组建私有网络,让手机、笔记本都能访问 Mac mini 上的模型(可选,单机使用可跳过)
选择模型:为什么是 Qwen3.6-35B-A3B
模型标识符 Qwen3.6-35B-A3B-OptiQ-4bit 的含义:
| 字段 | 含义 |
|---|---|
Qwen3.6 |
模型系列与版本 |
35B |
所有专家的总参数量 |
A3B |
每个 token 实际激活的参数仅 30 亿 |
OptiQ-4bit |
混合精度量化(主要 4 位,敏感层 8 位) |
关键点在于 A3B。这是一个 MoE(混合专家)架构模型——350 亿参数分布在 256 个专家中,但每次推理只激活约 30 亿参数。这意味着虽然模型文件较大,实际推理时的内存占用更接近一个 6B 稠密模型。
4 位量化下,该模型约占 20GB 内存,在 48GB 机器上还剩 28GB 给上下文窗口和系统使用,非常从容。
判断模型能否跑在你的硬件上
- 4 位量化模型文件大小 ≈ 参数量(GB),即 35B ≈ 17~20GB
- 减去 macOS 系统占用(约 6~8GB)
- 为上下文窗口预留 8~16GB(长对话场景)
- 确保总占用不超过可用统一内存的 85~90%,否则会交换到 SSD,体验急剧下降
部署步骤
第一步:安装 oMLX
从 omlx.app 下载安装,启动后它会在本地 8000 端口提供 OpenAI 兼容的 API 服务。
第二步:下载模型
将 Qwen3.6-35B-A3B-OptiQ-4bit 模型文件下载到 ~/models/ 目录。oMLX 会自动发现该目录下的新模型。你也可以直接在 oMLX 管理面板内置的 HuggingFace 浏览器中搜索并一键下载。
第三步:启动服务
在 oMLX 应用中选中模型,或重启服务器即可。模型开始接受推理请求。
第四步:连接客户端
任何支持 OpenAI API 格式的客户端都可以直接对接,将 API 地址设为:
http://[你的Mac-mini地址]:8000/v1
如果通过 Tailscale 组网,其他设备(手机、笔记本)也能直接访问这个地址,无需暴露到公网。
日常使用建议
- 轻量任务换小模型:如果只是简单问答或格式化,可以加载一个 2~4GB 的小模型(如 Gemma-4-E4B),避免动用 20GB 的大模型。
- 随时换新模型:新模型发布后,下载到
~/models/,oMLX 自动识别,重启即生效。整个过程不超过两分钟。 - 长对话注意内存:KV 缓存会随上下文增长,长会话时留意内存余量。
为什么值得这样做
本地部署的核心收益是确定性——成本固定(电费)、不受速率限制、数据不出本机、不依赖第三方随时可能变动的定价和模型质量。而 4 位量化的 Qwen3.6-35B-A3B 相比未压缩版本在基准测试上仅损失 1~2 分,对于编码、推理、工具调用等日常任务完全够用。
整套搭建大约 30 分钟,之后每一次推理都是免费的。