Skip to content
2026-09-29 04:20717 字AIDeepSeek推理加速工程化

DeepSeek 开源周五大工具 ​

2025 年 2 月,DeepSeek 连续五天开源五项训练/推理底层工具,统称「开源周(Open Source Week)」。这批工具不是模型本身,而是支撑 V3/R1 高效训练与推理的基础设施,核心目标是压榨 GPU 利用率、降低 MoE 通信与显存开销。

五大工具速览 ​

日期工具定位解决的问题
2/24FlashMLAHopper GPU(如 H800)的高效 MLA 解码内核优化变长序列处理 + 分页 KV 缓存,提升推理吞吐
2/25DeepEP专家并行(EP)通信库加速 MoE 训练/推理中 token 的分发与聚合,降低跨节点通信延迟,兼容国产算力
2/26DeepGEMMFP8 通用矩阵乘法(GEMM)库支持 V3 的细粒度缩放,驱动 V3/R1 的训练与推理
2/27DualPipe / EPLB并行计算优化策略DualPipe 双向流水线并行 + EPLB 专家并行负载均衡
2/283FS(萤火虫文件系统)高性能分布式文件系统应对 AI 训练/推理的大规模 IO 负载

关键技术点 ​

  • FlashMLA:面向 DeepSeek 的 MLA(多头潜在注意力)设计的解码内核,针对变长序列和分页 KV Cache 做深度优化,是把 MLA 的显存优势落到推理侧的工程实现。
  • DeepEP:MoE 模型训练/推理时,token 要在多张 GPU 间「分发到专家—再聚合」,通信极易成为瓶颈;DeepEP 专门优化这一步,显著降低节点间通信延迟。
  • DeepGEMM:为 FP8 矩阵运算而生,配合 V3 的精细化缩放(fine-grained scaling),让 FP8 混合精度训练/推理真正可用。
  • DualPipe:双向流水线并行算法,通过对称微批次调度 + 计算-通信重叠,将 GPU 闲置时间(bubble)削减 50% 以上;EPLB 负责专家并行的负载均衡。
  • 3FS:分布式文件系统,解决训练/推理阶段海量数据读写的 IO 吞吐问题。

意义 ​

这批工具把 DeepSeek 的「低成本高效率」从模型层延伸到系统层:MLA 省显存、MoE 省算力、FP8 省精度开销、流水线省 GPU 空转、3FS 省 IO 等待,共同构成 V3/R1 低成本训练的工程底座,也强化了其开源生态号召力。

⚠️ 时效:内容整理自 2025-05 的第三方文章,工具命名与细节以官方仓库为准。原文将 2/25 的「EP 通信库」即社区通称的 DeepEP。

延伸 ​

每一篇文章,都是时间的标本