M4 Pro Mac mini 部署本地模型 Qwen 教程

硬件与软件准备

你需要一台配备 48GB 统一内存的 M4 Pro Mac mini(32GB 也可以跑,但余量更小),以及以下软件:

  • oMLXomlx.app):本地推理服务器,负责加载和提供模型服务
  • Tailscaletailscale.com):组建私有网络,让手机、笔记本都能访问 Mac mini 上的模型(可选,单机使用可跳过)

选择模型:为什么是 Qwen3.6-35B-A3B

模型标识符 Qwen3.6-35B-A3B-OptiQ-4bit 的含义:

字段 含义
Qwen3.6 模型系列与版本
35B 所有专家的总参数量
A3B 每个 token 实际激活的参数仅 30 亿
OptiQ-4bit 混合精度量化(主要 4 位,敏感层 8 位)

关键点在于 A3B。这是一个 MoE(混合专家)架构模型——350 亿参数分布在 256 个专家中,但每次推理只激活约 30 亿参数。这意味着虽然模型文件较大,实际推理时的内存占用更接近一个 6B 稠密模型。

4 位量化下,该模型约占 20GB 内存,在 48GB 机器上还剩 28GB 给上下文窗口和系统使用,非常从容。

判断模型能否跑在你的硬件上

  1. 4 位量化模型文件大小 ≈ 参数量(GB),即 35B ≈ 17~20GB
  2. 减去 macOS 系统占用(约 6~8GB)
  3. 为上下文窗口预留 8~16GB(长对话场景)
  4. 确保总占用不超过可用统一内存的 85~90%,否则会交换到 SSD,体验急剧下降

部署步骤

第一步:安装 oMLX

从 omlx.app 下载安装,启动后它会在本地 8000 端口提供 OpenAI 兼容的 API 服务。

第二步:下载模型

Qwen3.6-35B-A3B-OptiQ-4bit 模型文件下载到 ~/models/ 目录。oMLX 会自动发现该目录下的新模型。你也可以直接在 oMLX 管理面板内置的 HuggingFace 浏览器中搜索并一键下载。

第三步:启动服务

在 oMLX 应用中选中模型,或重启服务器即可。模型开始接受推理请求。

第四步:连接客户端

任何支持 OpenAI API 格式的客户端都可以直接对接,将 API 地址设为:

http://[你的Mac-mini地址]:8000/v1 

如果通过 Tailscale 组网,其他设备(手机、笔记本)也能直接访问这个地址,无需暴露到公网。

日常使用建议

  • 轻量任务换小模型:如果只是简单问答或格式化,可以加载一个 2~4GB 的小模型(如 Gemma-4-E4B),避免动用 20GB 的大模型。
  • 随时换新模型:新模型发布后,下载到 ~/models/,oMLX 自动识别,重启即生效。整个过程不超过两分钟。
  • 长对话注意内存:KV 缓存会随上下文增长,长会话时留意内存余量。

为什么值得这样做

本地部署的核心收益是确定性——成本固定(电费)、不受速率限制、数据不出本机、不依赖第三方随时可能变动的定价和模型质量。而 4 位量化的 Qwen3.6-35B-A3B 相比未压缩版本在基准测试上仅损失 1~2 分,对于编码、推理、工具调用等日常任务完全够用。

整套搭建大约 30 分钟,之后每一次推理都是免费的。