M5 Ultra 本地大模型选型部署全攻略
2026-08-30
一个反直觉的事实
先问一个问题:跑一个像样的开源大模型,你需要什么?
很多人第一反应是”显卡”,而且是那种动辄两万起步、显存 24GB 封顶的”专业卡”。可现实是——一张 4090 的显存,连一个 70B 参数模型都塞不进去。想跑更强的?要么租服务器,要么按次付钱给云端 API。
但今年有台机器悄悄改变了这件事。它没有一张传统意义上的”显卡”,却能在本地跑起几百亿参数的模型,而且速度不慢。它就是 Mac Studio M5 Ultra——靠的不是算力碾压,而是一个被大多数人忽略的思路:既然显存装不下,那就别分家了。
这台机器的规格,值得先摆出来:
| 规格 | M5 Ultra(高配) |
|---|---|
| CPU | 36 核(10 超强核 + 20 性能核 + 6 能效核) |
| GPU | 80 核 |
| 神经引擎 | 硬件加速 |
| 统一内存 | 256GB / 512GB 可选 |
| 内存带宽 | 614GB/s |
| 显存/内存 | 不分家(统一内存) |
614GB/s 的带宽是什么概念?它比很多工作站显卡的显存带宽还高。而这正是跑大模型最吃紧的资源——内存带宽直接决定模型”吐字”的速度。
苹果的解法:把”墙”拆掉
传统电脑里,显卡有自己的”显存”,CPU 有自己的”内存”,中间隔着一堵墙。模型必须整个塞进那块小小的显存里才能跑——这就是为什么 24GB 封顶、为什么大模型在个人电脑上跑不起来。
苹果的 M 系列芯片做了一个大胆的决定:CPU 和 GPU 共用一块内存。256GB 的 Mac Studio,对 AI 来说意味着:
一、模型权重、运行缓存、操作系统,全部装进同一块内存;
二、不再有”显存不够”这道天花板,只有”内存够不够”这一个问题;
三、256GB + 614GB/s 带宽,足够装下一个普通 PC 想都不敢想的模型,而且跑得动。
用大白话说:别人是”小房间摆满了书桌”(显存小,摆不下几本书),Mac 是”一个大仓库”(桌子不算特别强,但所有书都能放下,而且拿书极快)。
而框架层面,苹果给了 MLX——官方为自家芯片量身定做的机器学习框架。它直接调用 M 系列 GPU 和统一内存,把带宽优势吃到最满。外来的 SGLang 主要面向 NVIDIA/AMD 数据中心,在 Mac 上没戏;llama.cpp 能用但没吃到 Metal 的原生加速。在 Mac 上跑 AI,MLX 就是那个”原厂件”。
三个选手,各怀绝技
现在重头戏来了。在本地跑大模型,有三款开源模型值得认真看一眼。它们都是同一种聪明架构:MoE(混合专家)——总参数量巨大,但每次只激活一小部分”专家”来干活。就像一家大公司有几百个部门,但处理每件事只叫上几个人。于是”见得多”和”跑得快”可以同时成立。
而 MoE 在 MLX 上的意义尤其大:因为只激活一小部分参数,MLX 可以把不用的专家留在内存里、只把干活的那几个搬进计算路径——内存带宽和算力都省下来了。
DeepSeek-V4-Flash —— 读得最多的那一个
档案:284B 总参数 / 13B 激活 · 上下文 100 万 token · FP4+FP8 混合精度
DeepSeek 是深度求索的旗舰系列,V4-Flash 是其中”轻量但能打”的版本。它的绝活是 1M 上下文——什么概念?一本书几十万 token,它能一口气读完好几本,还记得住前后文。
权威测试得分(官方发布,DeepSeek-V4-Flash Max 推理模式):
| 测试(能力) | V4-Flash Max | V4-Pro Max(对比) |
|---|---|---|
| MMLU-Pro(通用知识) | 86.2 | 87.5 |
| GPQA Diamond(科学推理) | 88.1 | 90.1 |
| HLE(综合推理) | 34.8 | 37.7 |
| LiveCodeBench(竞赛代码) | 91.6 | 93.5 |
| Codeforces(竞赛评级) | 3052 | 3206 |
| IMOAnswerBench(数学竞赛) | 88.4 | 89.8 |
| SWE Verified(真实代码修复) | 79.0 | 80.6 |
| MRCR 1M(百万级长文理解) | 78.7 | 83.5 |
亮点解读:
一、它的”Max”推理模式在代码竞赛(Codeforces 3052 分,约全球前 1%)和真实代码修复(SWE Verified 79.0)上,已经追平自家 1.6T 参数的 Pro 版。
二、1M 长文理解(MRCR 1M = 78.7)是它的独门绝技——在处理”百万 token 还得记得住”这个地狱难度任务上,它全球顶尖。
三、数学竞赛 IMOAnswerBench 88.4,能解国际数学奥林匹克级别的问题。
速度点评:13B 激活参数是所有候选里第二小的,在 MLX 上解码速度预计 30-50 token/s(取决于量化档),属于”大储备、快响应”的典型。1M 上下文是它最大的差异化卖点,但也意味着长文档首轮处理会慢一些。
适合:超长文档分析、整个代码库理解、跨几十万字找关联、复杂推理。
GLM-5.3-Flash —— 写代码最狠的那一个
档案:320B 总参数 / 18B 激活 · 上下文 300K+ · 原生多模态(能看图)
智谱今年推出的 GLM-5 系列首款原生多模态模型,320B 储备是三款里最大的,也是第一个天生会看图的 GLM。
权威测试得分(官方发布):
| 测试(能力) | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 |
|---|---|---|---|
| DeepSWE v1.1(编程智能体) | 63.4 | 46.2 | 接近 |
| AutomationBench(自动化任务) | 48.8 | 26.2 | 接近 |
| Terminal-Bench 2.1(终端操作) | 81.0 | 81.0 | 85.0 |
| SWE-bench Pro(代码修复) | 62.1 | 62.1 | — |
亮点解读:
一、编程智能体 DeepSWE 63.4,三款中最高(超 Qwen 58.7、DeepSeek 54.4)。
二、AutomationBench 48.8,是 GLM-5.2 的两倍(26.2)——”让 AI 自动操作软件完成任务”这个方向,它进步巨大。
三、官方原话:”在编程和智能体任务上逼近 Claude Opus 4.8″——而 Opus 4.8 是当前最顶尖的闭源模型。
四、原生多模态:不仅会写代码,还能看 UI 截图、理解图表、处理视觉输入。
速度点评:18B 激活是三款里最大的,速度会慢一些(预计 20-35 token/s),但换来的是最强储备和视觉能力。对”让 AI 自主干活”(智能体)场景,它是首选——这类任务往往不在乎慢几秒,而在乎能不能一次做对。
适合:高难度编程、自主智能体、UI 开发(看图写前端)、需要最强综合能力的工作。
Qwen3.8-Flash-Next —— 最会省电的那一个
档案:125B 总参数 / 6B 激活 + 51B N-gram 嵌入 · 上下文 262K · 视觉
阿里巴巴放出的 Qwen 下一代架构(Qwen4 前奏)预览版,是这三款里架构最新、也最”反常”的一个。它用了一套叫 N-gram 嵌入的技术——把 51B 参数做成一个”记忆库”,可以按需加载、不占运行内存。于是 125B 的储备,每轮只激活 6B 就干活。
权威测试得分(官方发布,直接对标 DeepSeek-V4-Flash 和 Claude):
| 测试(能力) | Qwen3.8-Flash-Next | Qwen3.8-27B | DeepSeek-V4-Flash | Claude Opus 4.6 |
|---|---|---|---|---|
| DeepSWE 1.1(编程智能体) | 58.7 | 42.2 | 54.4 | — |
| SWE-bench Pro(代码修复) | 62.5 | 61.7 | 56.0 | 53.4 |
| SWE-bench 多语言 | 81.0 | 73.8 | — | 77.5 |
| NL2Repo(仓库级代码生成) | 48.1 | 42.3 | 54.2 | 47.6 |
| IFBench(指令遵循) | 81.3 | 79.5 | 79.2 | 62.5 |
| GPQA Diamond(科学推理) | 91.7 | 89.2 | 90.8 | 91.3 |
| HLE(综合推理) | 35.9 | 30.8 | 33.8 | 40.0 |
| LiveCodeBench v6(竞赛代码) | 91.9 | 90.3 | 90.6 | 88.8 |
亮点解读:
一、编程智能体 DeepSWE 58.7,反超 DeepSeek-V4-Flash(54.4)——这是最反直觉的:它激活参数只有 DeepSeek 的一半,编程智能体却更强。
二、代码修复 SWE-bench Pro 62.5,超过 Claude Opus 4.6(53.4)。
三、指令遵循 IFBench 81.3,三款最高——”听懂人话、按指令办事”能力突出。
四、竞赛代码 LiveCodeBench 91.9,压过 DeepSeek(90.6)和 Claude(88.8)。
五、视觉能力 + 262K 上下文 + 6B 激活——又省又快还能打。
速度点评:6B 激活是三款里最小的,在 M5 Ultra 上解码速度预计 50-80 token/s(取决于量化档),几乎是”实时打字”的体验。配合 256GB 内存,还能同时再塞一个别的模型。是日常使用的性价比之王。
三款怎么选?一张表看懂
| 模型 | 总参/激活 | 上下文 | 最强项 | 预计速度(MLX 4bit) | 定位 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash | 284B/13B | 1M | 长文+代码修复 | 30-50 t/s | 读得最多 |
| GLM-5.3-Flash | 320B/18B | 300K+ | 编程智能体+视觉 | 20-35 t/s | 写代码最狠 |
| Qwen3.8-Flash-Next | 125B/6B | 262K | 效率+指令遵循 | 50-80 t/s | 最会省电 |
> 速度数据为基于 M5 Ultra(614GB/s 带宽)+ MoE 激活参数的估算区间,实际受量化档位、上下文长度影响。MLX 社区对 M5 Ultra 的精确 benchmark 尚未大量发布。
按需求选
要”读得多、记得住” —— 超长文档、整个代码库、跨几十万字找关联。选 DeepSeek-V4-Flash。1M 上下文独一档。
要”代码最猛、还能自己干活” —— 高难度编程、让 AI 自主操作电脑。选 GLM-5.3-Flash。DeepSWE 63.4 是最接近”超级程序员”的。
要”日常什么都干、又快又省” —— 长文本、看图、中等强度写代码。选 Qwen3.8-Flash-Next。6B 激活最快,还能同时塞第二个模型。
想装两个:Qwen + GLM(约 223GB)最从容;Qwen + DeepSeek(约 264GB)稍挤。追求极致质量:单跑 DeepSeek 4bit(151GB)余量最大。
落地:在 M5 Ultra 上跑起来
# 安装 MLX 框架
pip install mlx-lm
# 三款模型的推荐 MLX 版本
mlx_lm.chat --model Vontra/Qwen3.8-Flash-Next-MLX-oQ4-MTP # 113GB
mlx_lm.chat --model mlx-community/DeepSeek-V4-Flash-4bit # 151GB
mlx_lm.chat --model Vontra/GLM-5.3-Flash-MLX-oQ2-MTP # 110GB
内存规划
一、256GB 跑 150GB 级模型绰绰有余(留 100GB 给缓存和系统)。
二、双模型:优先 Qwen(113GB)+ GLM(110GB),共 223GB,还留 33GB 余量。
三、别把 256GB 塞满:系统、运行缓存、MLX 的 KV 缓存都要空间,模型总占用控制在 200GB 内。
几个常识
一、“总参数” ≠ “占用内存”:MoE 按需加载,别被 300B 吓到。
二、量化档位要看清:2bit/4bit/8bit。4bit 是质量和体积的平衡点;2bit 更省但会掉智商;8bit 质量最好但体积大。
三、MTP(投机解码):部分 MLX 版本支持”猜下一步”加速,可提升生成速度,Qwen 和 GLM 的 oQ 版已内置。
最后
很多人以为”本地跑大模型”是显卡发烧友的专利,或者干脆认命用云 API。但 Mac Studio M5 Ultra 用一块共享内存,把这件事拉回到了普通人的桌面上——不用租服务器、不用付 API 费、数据不出本机。
读得最多的是 DeepSeek,写代码最狠的是 GLM,最会省电的是 Qwen。它们各自的得分、速度、专长都在上面了,你的 256GB 装得下其中任何一个,甚至两个。
至于选谁——先想清楚你最常让 AI 干什么,再看那张表。剩下的,就是装好 MLX,敲下那条命令,然后把”跑大模型”这件事,从别人的故事变成你自己的。
文中得分均来自 Qwen3.8-Flash-Next / DeepSeek-V4-Flash / GLM-5.3-Flash 官方发布(Hugging Face / 官方博客),M5 Ultra 规格来自 Apple 官方。MLX 速度区间为基于硬件带宽与激活参数的估算,精确值以实际测为准。
