DeepSeek-Math 数理逻辑解码
本文基于《DeepSeek-Math 技术报告精译》与 D5 核心技术专题, 对 DeepSeek-Math 的数理逻辑能力进行系统性梳理. Math 是 DeepSeek 在数学推理领域的专项模型, 首次提出了 GRPO 算法. 详细分析请参阅 05-DeepSeek-Math-Mathematical-Reasoning.md.
1 设计动机: 数学推理的特殊挑战
DeepSeek-Math 发布于 2024 年 2 月, 其核心任务是解决数学推理的三个挑战:
- 精确性: 数学答案需要完全正确, 近似或部分正确都不得分.
- 多步推理: 复杂数学问题需要数十步的逻辑推导.
- 形式多样性: 数学问题涵盖代数、几何、微积分、概率等多个子领域.
译者注: 数学推理是检验大模型逻辑能力的「试金石」. 与开放式文本生成不同, 数学问题的答案可以被客观验证, 这使得数学成为研究推理机制的理想领域. DeepSeek-Math 的探索直接催生了 R1-Zero 的纯 RL 训练范式.
2 整体架构
| 超参数 | Math 配置 |
|---|---|
| 架构 | Dense Transformer |
| 模型尺寸 | 7B |
| 基础模型 | DeepSeek-Coder-Base-v1.5 7B |
| 预训练数据 | 120B 数学 token |
| 上下文窗口 | 4K |
表 1: DeepSeek-Math 核心配置.
Math 选择 7B Dense 模型而非更大的 MoE, 原因是: 数学推理主要依赖逻辑能力而非参数容量, 且 7B 模型便于快速实验和迭代.
3 核心创新
3.1 数学预训练数据工程
DeepSeek-Math 收集了 120B 数学相关的 token, 来源包括:
- 网页上的数学内容(经过质量过滤)
- 数学教科书和论文
- 代码中的数学实现
数据清洗流程:
- 数学内容识别: 使用启发式规则识别包含数学表达式的网页.
- 质量评分: 基于内容长度、公式密度、逻辑结构等指标评分.
- 去重: 去除重复的数学问题和证明.
3.2 GRPO 的起源
DeepSeek-Math 首次提出了 Group Relative Policy Optimization(GRPO), 这是 R1-Zero 和 R1 的核心 RL 算法.
GRPO 的核心洞察: 在数学推理中, 价值模型难以准确预测多步推理的最终奖励. 因为推理过程中的中间步骤可能看起来合理, 但最终答案却完全错误.
GRPO 的解决方案是组内相对评分: 对于同一个问题, 采样多个输出, 用它们之间的相对比较来计算优势, 而不是依赖价值模型的绝对预测.
译者注: GRPO 的设计体现了 DeepSeek 团队对 RL 本质的深刻理解. 传统 PPO 的价值模型在短文本生成中工作良好, 因为部分响应可以较好地预测最终质量. 但在长思维链场景中, 模型可能在生成过程中进行反思和修正, 使得基于部分响应的预测几乎不可能. GRPO 通过「相对比较」绕开了这个难题, 这一思路后来被推广到所有需要长推理的场景.
3.3 迭代 RL 训练
DeepSeek-Math 采用迭代 RL 训练:
- 用当前模型生成大量推理轨迹.
- 过滤出答案正确的轨迹作为新的训练数据.
- 用新数据继续训练模型.
- 重复上述过程多轮.
这种自举(bootstrapping)方式使得模型可以逐步提升推理能力, 类似于 AlphaGo 的自我对弈.
4 性能与影响
| 基准 | DeepSeek-Math 7B | GPT-4 | Minerva 540B |
|---|---|---|---|
| GSM8K | 64.2% | 92.0% | 58.8% |
| MATH | 36.2% | 42.5% | 33.6% |
| College Math | 38.6% | - | - |
DeepSeek-Math 7B 在多个数学基准上超越了 540B 的 Minerva, 证明了「领域数据 + 专门训练」可以弥补参数量的差距.
更重要的是, DeepSeek-Math 的探索直接影响了后续模型:
- GRPO: 成为 R1-Zero 和 R1 的核心 RL 算法.
- 迭代 RL: 启发了 R1 的多阶段训练流水线.
- 数学数据工程: 为 Qwen2.5-Math 等模型提供了方法论参考.
本文档为数理逻辑解码. 详细精译见《01-DeepSeek-Math技术报告精译.md》, GRPO 深入分析见《05-DeepSeek-Math-Mathematical-Reasoning.md》.