DeepSeek V4千亿MoE本地运行实战:llama.cpp新合并全解析,1M上下文触手可及

llama.cpp 近期正式合并了对 DeepSeek V4 的推理支持(PR #24162),这让用户在个人设备上也能体验拥有百万级上下文窗口的千亿参数混合专家模型,而不再需要依赖云端算力。此次合并备受关注,在 Reddit 的 r/LocalLLaMA 板块引发了超过 200 条讨论。
1.6T / 49B
总参数 / 激活参数
1M / 384K
上下文 / 生成长度
~748 / ~20
预填 t/s / 生成 t/s(Flash Attention 下)
本次合并由开发者 am17an 主导推进,fairydreaming 负责 CUDA 优化与 Flash Attention 集成,经 CISC、ggerganov 等人审阅,历时 49 次提交完成。合并的 PR 完整覆盖了 DeepSeek V4 两款产品:V4-Flash(284B 总参数,13B 激活参数)与 V4-Pro(1.6T 总参数,49B 激活参数),统一使用 deepseek4 架构标识。
对于热衷本地推理的用户而言,这是 DeepSeek V4 自 4 月 24 日开源以来,在开源推理引擎生态中走出的最关键一步。
压缩注意力:百万上下文能在单卡上跑起来的秘密
DeepSeek V4 在架构上区别于 V3 系列的最大创新在于注意力机制。它没有沿用标准全自注意力或多层稀疏方案,而是设计了一套名为 CSA + HCA 的混合压缩注意力架构。
- CSA(Compressed Sparse Attention):将每 4 个词元压缩为 1 个,并结合 top-k 稀疏注意力,同时保留最近 8 个词元的完整注意力窗口。
- HCA(Heavily Compressed Attention):以 128:1 进行重度压缩,用来捕捉超长距离依赖关系。
- mHC(Manifold-Constrained Hyper-Connections):以受 Sinkhorn 约束的混合矩阵替代传统残差连接,解决了训练过程中信号增益可能超过 3000 倍带来的不稳定难题。
关键点:在 1M 上下文长度的场景下,CSA+HCA 架构仅需 V3.2 注意力架构 27% 的推理计算量和 10% 的 KV 缓存量。这正是该模型能够在消费级硬件上运行的直接原因。
llama.cpp 为此专门引入了 6 组新算子,包括 ggml_dsv4_rope_tail、ggml_dsv4_hc_split_sinkhorn 以及 ggml_dsv4_fp8_kv_quantize。这些算子在 GPU 上执行压缩方案,而 CPU 回退路径目前仍在持续完善中。
性能全景:从 Mac Studio 到双路专业卡
此次 PR 提供了多套硬件配置下的基准测试数据,以下三组最具参考价值:
| 硬件配置 | 量化方案 | 预填/生成性能 |
|---|---|---|
| DGX Spark GB10 | Flash IQ2_XXS (80.8G) | PP 148 t/s,TG 6 t/s |
| M3 Ultra (192GB) | Flash Q4_K_M-XL | TG 22.85 t/s |
| M3 Ultra (192GB) | Flash Q2_K-XL | TG 23.38 t/s |
| RTX PRO 6000 Max-Q(FA 优化后) | Flash | 预填 744.89 t/s (8K),65K 时仍有 635 t/s;生成 20.24 t/s (8K),52万上下文时降至 7.59 t/s |
| RTX PRO 6000 Max-Q(FA 优化后) | Pro | 预填 178.61 t/s,生成 5.86 t/s(13万上下文) |
| 社区方案(2x RTX PRO 6000 + MTP 自推测) | Flash | 达到约 85 tok/s |
不同配置间生成速度的差异极为显著:fairydreaming 的 Flash Attention 优化将早期 WIP 版本仅 5–6 t/s 的速度提升到了 20+ t/s,差距达 3–4 倍。这意味着,相比模型精度本身,是否开启 Flash Attention 更容易决定性能的释放程度。
多数社区成员对此次合并充满期待,普遍认为“本地运行 V4”终于成为现实。不过需要理性看待的是,V4-Flash 的生成速度仍比当前主流的 7B/13B 模型慢一个数量级,它更适合离线推理和长上下文实验,不适合需要即时响应的交互场景。
上手路径:你需要怎样的硬件和软件
目前合并代码尚未纳入 llama.cpp 稳定版,须自行从 master 分支编译。GGUF 模型文件可以从 antirez 的 Hugging Face 仓库获取,该仓库月下载量已超过 640 万次。
- IQ2_XXS 量化(80.8 GiB):路由专家部分采用 IQ2_XXS,注意力投影和共享专家使用 Q8_0。适合 128GB 内存的 Mac 用户,是当前最低可行配置的入门选择。
- Q4_K 量化(153.3 GiB):路由专家采用 Q4_K,质量更高,需要 256GB 以上内存。
- MTP 模块(3.6 GiB):antirez 额外提供了一个推测解码模块,可与主模型搭配使用以进一步提升生成速度。
⚠️ 硬件门槛
- V4-Flash 最低配置:128GB 统一内存(Mac)/ 96GB+ 显存(NVIDIA),约需 170GB 磁盘空间。
- V4-Pro:量化版占磁盘 860–900GB,需要 256GB 以上内存。对绝大多数本地用户而言,现阶段不建议尝试。
需要注意,antirez 的 GGUF 文件采用了与上游 PR 相同的量化方案,但部分早期版本存在张量命名差异。若加载时遇到报错,请确认使用的是最新版 GGUF 文件。fairydreaming 已在 PR 后期完成了兼容性修复。
当前局限与后续规划
合并后的实现仍有若干明确缺口:
- n_seq=1 限制:初步合并仅支持序列长度为 1,无法进行批处理或多用户推理,当前仅可用于单用户交互。
- CPU 回退未完成:压缩注意力算子的 CPU 路径仍在开发中,在 GPU 显存不足的机器上目前无法优雅回退。
- 量化精度考量:V4 原生采用 FP8+FP4 混合精度训练,IQ2_XXS 级别的量化可能带来较明显的质量损失。如果对输出质量要求较高,Q4_K 是更稳妥的起点。
后续路线图包括:MTP 自推测解码的深度集成、Compressed Attention 算子的进一步优化,以及多序列支持的扩展。这些改进已在独立分支上推进,预计未来 4–6 周内会陆续合入。
如果你拥有 128GB 以上内存的 Mac 或 96GB+ 显存的 NVIDIA 显卡,现在就可以从 antirez 的 GGUF 仓库下载 V4-Flash IQ2_XXS 量化版开始测试。但如果目标是部署生产级推理服务,则需要再等待几个版本——n_seq=1 的限制意味着它目前仍只是单用户研究工具,而非成熟的部署方案。
参考来源
- am17an, “deepseek-v4: initial support for DeepSeek V4 models” — GitHub ggml-org/llama.cpp PR #24162
- DeepSeek, “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence” — Hugging Face / technical report
- antirez, “deepseek-v4-gguf” — Hugging Face / antirez
- r/LocalLLaMA, “DeepSeek V4 PR merged into llama.cpp” — Reddit 2026-06-29