M5 Ultra 本地大模型选型部署全攻略

M5 Ultra 本地大模型选型部署全攻略

2026-08-30

一个反直觉的事实

先问一个问题:跑一个像样的开源大模型,你需要什么?
很多人第一反应是”显卡”,而且是那种动辄两万起步、显存 24GB 封顶的”专业卡”。可现实是——一张 4090 的显存,连一个 70B 参数模型都塞不进去。想跑更强的?要么租服务器,要么按次付钱给云端 API。
但今年有台机器悄悄改变了这件事。它没有一张传统意义上的”显卡”,却能在本地跑起几百亿参数的模型,而且速度不慢。它就是 Mac Studio M5 Ultra——靠的不是算力碾压,而是一个被大多数人忽略的思路:既然显存装不下,那就别分家了。
这台机器的规格,值得先摆出来:

规格 M5 Ultra(高配)
CPU 36 核(10 超强核 + 20 性能核 + 6 能效核)
GPU 80 核
神经引擎 硬件加速
统一内存 256GB / 512GB 可选
内存带宽 614GB/s
显存/内存 不分家(统一内存)

614GB/s 的带宽是什么概念?它比很多工作站显卡的显存带宽还高。而这正是跑大模型最吃紧的资源——内存带宽直接决定模型”吐字”的速度。

苹果的解法:把”墙”拆掉

传统电脑里,显卡有自己的”显存”,CPU 有自己的”内存”,中间隔着一堵墙。模型必须整个塞进那块小小的显存里才能跑——这就是为什么 24GB 封顶、为什么大模型在个人电脑上跑不起来。

苹果的 M 系列芯片做了一个大胆的决定:CPU 和 GPU 共用一块内存。256GB 的 Mac Studio,对 AI 来说意味着:

一、模型权重、运行缓存、操作系统,全部装进同一块内存;

二、不再有”显存不够”这道天花板,只有”内存够不够”这一个问题;

三、256GB + 614GB/s 带宽,足够装下一个普通 PC 想都不敢想的模型,而且跑得动。

用大白话说:别人是”小房间摆满了书桌”(显存小,摆不下几本书),Mac 是”一个大仓库”(桌子不算特别强,但所有书都能放下,而且拿书极快)。

而框架层面,苹果给了 MLX——官方为自家芯片量身定做的机器学习框架。它直接调用 M 系列 GPU 和统一内存,把带宽优势吃到最满。外来的 SGLang 主要面向 NVIDIA/AMD 数据中心,在 Mac 上没戏;llama.cpp 能用但没吃到 Metal 的原生加速。在 Mac 上跑 AI,MLX 就是那个”原厂件”。

三个选手,各怀绝技

现在重头戏来了。在本地跑大模型,有三款开源模型值得认真看一眼。它们都是同一种聪明架构:MoE(混合专家)——总参数量巨大,但每次只激活一小部分”专家”来干活。就像一家大公司有几百个部门,但处理每件事只叫上几个人。于是”见得多”和”跑得快”可以同时成立。

而 MoE 在 MLX 上的意义尤其大:因为只激活一小部分参数,MLX 可以把不用的专家留在内存里、只把干活的那几个搬进计算路径——内存带宽和算力都省下来了。

DeepSeek-V4-Flash —— 读得最多的那一个

档案:284B 总参数 / 13B 激活 · 上下文 100 万 token · FP4+FP8 混合精度

DeepSeek 是深度求索的旗舰系列,V4-Flash 是其中”轻量但能打”的版本。它的绝活是 1M 上下文——什么概念?一本书几十万 token,它能一口气读完好几本,还记得住前后文。

权威测试得分(官方发布,DeepSeek-V4-Flash Max 推理模式):

测试(能力) V4-Flash Max V4-Pro Max(对比)
MMLU-Pro(通用知识) 86.2 87.5
GPQA Diamond(科学推理) 88.1 90.1
HLE(综合推理) 34.8 37.7
LiveCodeBench(竞赛代码) 91.6 93.5
Codeforces(竞赛评级) 3052 3206
IMOAnswerBench(数学竞赛) 88.4 89.8
SWE Verified(真实代码修复) 79.0 80.6
MRCR 1M(百万级长文理解) 78.7 83.5

亮点解读:

一、它的”Max”推理模式在代码竞赛(Codeforces 3052 分,约全球前 1%)和真实代码修复(SWE Verified 79.0)上,已经追平自家 1.6T 参数的 Pro 版。

二、1M 长文理解(MRCR 1M = 78.7)是它的独门绝技——在处理”百万 token 还得记得住”这个地狱难度任务上,它全球顶尖。

三、数学竞赛 IMOAnswerBench 88.4,能解国际数学奥林匹克级别的问题。

速度点评:13B 激活参数是所有候选里第二小的,在 MLX 上解码速度预计 30-50 token/s(取决于量化档),属于”大储备、快响应”的典型。1M 上下文是它最大的差异化卖点,但也意味着长文档首轮处理会慢一些。

适合:超长文档分析、整个代码库理解、跨几十万字找关联、复杂推理。

GLM-5.3-Flash —— 写代码最狠的那一个

档案:320B 总参数 / 18B 激活 · 上下文 300K+ · 原生多模态(能看图)

智谱今年推出的 GLM-5 系列首款原生多模态模型,320B 储备是三款里最大的,也是第一个天生会看图的 GLM。

权威测试得分(官方发布):

测试(能力) GLM-5.3-Flash GLM-5.2 Claude Opus 4.8
DeepSWE v1.1(编程智能体) 63.4 46.2 接近
AutomationBench(自动化任务) 48.8 26.2 接近
Terminal-Bench 2.1(终端操作) 81.0 81.0 85.0
SWE-bench Pro(代码修复) 62.1 62.1

亮点解读:

一、编程智能体 DeepSWE 63.4,三款中最高(超 Qwen 58.7、DeepSeek 54.4)。

二、AutomationBench 48.8,是 GLM-5.2 的两倍(26.2)——”让 AI 自动操作软件完成任务”这个方向,它进步巨大。

三、官方原话:”在编程和智能体任务上逼近 Claude Opus 4.8″——而 Opus 4.8 是当前最顶尖的闭源模型。

四、原生多模态:不仅会写代码,还能看 UI 截图、理解图表、处理视觉输入。

速度点评:18B 激活是三款里最大的,速度会慢一些(预计 20-35 token/s),但换来的是最强储备和视觉能力。对”让 AI 自主干活”(智能体)场景,它是首选——这类任务往往不在乎慢几秒,而在乎能不能一次做对。

适合:高难度编程、自主智能体、UI 开发(看图写前端)、需要最强综合能力的工作。

Qwen3.8-Flash-Next —— 最会省电的那一个

档案:125B 总参数 / 6B 激活 + 51B N-gram 嵌入 · 上下文 262K · 视觉

阿里巴巴放出的 Qwen 下一代架构(Qwen4 前奏)预览版,是这三款里架构最新、也最”反常”的一个。它用了一套叫 N-gram 嵌入的技术——把 51B 参数做成一个”记忆库”,可以按需加载、不占运行内存。于是 125B 的储备,每轮只激活 6B 就干活。

权威测试得分(官方发布,直接对标 DeepSeek-V4-Flash 和 Claude):

测试(能力) Qwen3.8-Flash-Next Qwen3.8-27B DeepSeek-V4-Flash Claude Opus 4.6
DeepSWE 1.1(编程智能体) 58.7 42.2 54.4
SWE-bench Pro(代码修复) 62.5 61.7 56.0 53.4
SWE-bench 多语言 81.0 73.8 77.5
NL2Repo(仓库级代码生成) 48.1 42.3 54.2 47.6
IFBench(指令遵循) 81.3 79.5 79.2 62.5
GPQA Diamond(科学推理) 91.7 89.2 90.8 91.3
HLE(综合推理) 35.9 30.8 33.8 40.0
LiveCodeBench v6(竞赛代码) 91.9 90.3 90.6 88.8

亮点解读:

一、编程智能体 DeepSWE 58.7,反超 DeepSeek-V4-Flash(54.4)——这是最反直觉的:它激活参数只有 DeepSeek 的一半,编程智能体却更强。

二、代码修复 SWE-bench Pro 62.5,超过 Claude Opus 4.6(53.4)。

三、指令遵循 IFBench 81.3,三款最高——”听懂人话、按指令办事”能力突出。

四、竞赛代码 LiveCodeBench 91.9,压过 DeepSeek(90.6)和 Claude(88.8)。

五、视觉能力 + 262K 上下文 + 6B 激活——又省又快还能打。

速度点评:6B 激活是三款里最小的,在 M5 Ultra 上解码速度预计 50-80 token/s(取决于量化档),几乎是”实时打字”的体验。配合 256GB 内存,还能同时再塞一个别的模型。是日常使用的性价比之王。

三款怎么选?一张表看懂

模型 总参/激活 上下文 最强项 预计速度(MLX 4bit) 定位
DeepSeek-V4-Flash 284B/13B 1M 长文+代码修复 30-50 t/s 读得最多
GLM-5.3-Flash 320B/18B 300K+ 编程智能体+视觉 20-35 t/s 写代码最狠
Qwen3.8-Flash-Next 125B/6B 262K 效率+指令遵循 50-80 t/s 最会省电

> 速度数据为基于 M5 Ultra(614GB/s 带宽)+ MoE 激活参数的估算区间,实际受量化档位、上下文长度影响。MLX 社区对 M5 Ultra 的精确 benchmark 尚未大量发布。

按需求选

要”读得多、记得住” —— 超长文档、整个代码库、跨几十万字找关联。选 DeepSeek-V4-Flash。1M 上下文独一档。

要”代码最猛、还能自己干活” —— 高难度编程、让 AI 自主操作电脑。选 GLM-5.3-Flash。DeepSWE 63.4 是最接近”超级程序员”的。

要”日常什么都干、又快又省” —— 长文本、看图、中等强度写代码。选 Qwen3.8-Flash-Next。6B 激活最快,还能同时塞第二个模型。

想装两个:Qwen + GLM(约 223GB)最从容;Qwen + DeepSeek(约 264GB)稍挤。追求极致质量:单跑 DeepSeek 4bit(151GB)余量最大。

落地:在 M5 Ultra 上跑起来

# 安装 MLX 框架
pip install mlx-lm
# 三款模型的推荐 MLX 版本
mlx_lm.chat --model Vontra/Qwen3.8-Flash-Next-MLX-oQ4-MTP      # 113GB
mlx_lm.chat --model mlx-community/DeepSeek-V4-Flash-4bit       # 151GB
mlx_lm.chat --model Vontra/GLM-5.3-Flash-MLX-oQ2-MTP           # 110GB

内存规划

一、256GB 跑 150GB 级模型绰绰有余(留 100GB 给缓存和系统)。
二、双模型:优先 Qwen(113GB)+ GLM(110GB),共 223GB,还留 33GB 余量。
三、别把 256GB 塞满:系统、运行缓存、MLX 的 KV 缓存都要空间,模型总占用控制在 200GB 内。

几个常识

一、“总参数” ≠ “占用内存”:MoE 按需加载,别被 300B 吓到。
二、量化档位要看清:2bit/4bit/8bit。4bit 是质量和体积的平衡点;2bit 更省但会掉智商;8bit 质量最好但体积大。
三、MTP(投机解码):部分 MLX 版本支持”猜下一步”加速,可提升生成速度,Qwen 和 GLM 的 oQ 版已内置。

最后

很多人以为”本地跑大模型”是显卡发烧友的专利,或者干脆认命用云 API。但 Mac Studio M5 Ultra 用一块共享内存,把这件事拉回到了普通人的桌面上——不用租服务器、不用付 API 费、数据不出本机。
读得最多的是 DeepSeek,写代码最狠的是 GLM,最会省电的是 Qwen。它们各自的得分、速度、专长都在上面了,你的 256GB 装得下其中任何一个,甚至两个。
至于选谁——先想清楚你最常让 AI 干什么,再看那张表。剩下的,就是装好 MLX,敲下那条命令,然后把”跑大模型”这件事,从别人的故事变成你自己的。


文中得分均来自 Qwen3.8-Flash-Next / DeepSeek-V4-Flash / GLM-5.3-Flash 官方发布(Hugging Face / 官方博客),M5 Ultra 规格来自 Apple 官方。MLX 速度区间为基于硬件带宽与激活参数的估算,精确值以实际测为准。


皖ICP备2025105865号-2|皖公网安备34010402704739号