DeepSeek-Math 数理逻辑解码

From LLM Guide

本文内容为中文原文;Article content is the original Chinese source, and this page does not provide a translation.

DeepSeek-Math 数理逻辑解码

🔙 返回 14.1-DeepSeek 家族总览

本文基于《DeepSeek-Math 技术报告精译》与 D5 核心技术专题, 对 DeepSeek-Math 的数理逻辑能力进行系统性梳理. Math 是 DeepSeek 在数学推理领域的专项模型, 首次提出了 GRPO 算法. 详细分析请参阅 05-DeepSeek-Math-Mathematical-Reasoning.md.


1 设计动机: 数学推理的特殊挑战

DeepSeek-Math 发布于 2024 年 2 月, 其核心任务是解决数学推理的三个挑战:

  1. 精确性: 数学答案需要完全正确, 近似或部分正确都不得分.
  2. 多步推理: 复杂数学问题需要数十步的逻辑推导.
  3. 形式多样性: 数学问题涵盖代数、几何、微积分、概率等多个子领域.

译者注: 数学推理是检验大模型逻辑能力的「试金石」. 与开放式文本生成不同, 数学问题的答案可以被客观验证, 这使得数学成为研究推理机制的理想领域. DeepSeek-Math 的探索直接催生了 R1-Zero 的纯 RL 训练范式.


2 整体架构

超参数 Math 配置
架构 Dense Transformer
模型尺寸 7B
基础模型 DeepSeek-Coder-Base-v1.5 7B
预训练数据 120B 数学 token
上下文窗口 4K

表 1: DeepSeek-Math 核心配置.

Math 选择 7B Dense 模型而非更大的 MoE, 原因是: 数学推理主要依赖逻辑能力而非参数容量, 且 7B 模型便于快速实验和迭代.


3 核心创新

3.1 数学预训练数据工程

DeepSeek-Math 收集了 120B 数学相关的 token, 来源包括:

  • 网页上的数学内容(经过质量过滤)
  • 数学教科书和论文
  • 代码中的数学实现

数据清洗流程:

  1. 数学内容识别: 使用启发式规则识别包含数学表达式的网页.
  2. 质量评分: 基于内容长度、公式密度、逻辑结构等指标评分.
  3. 去重: 去除重复的数学问题和证明.

3.2 GRPO 的起源

DeepSeek-Math 首次提出了 Group Relative Policy Optimization(GRPO), 这是 R1-Zero 和 R1 的核心 RL 算法.

GRPO 的核心洞察: 在数学推理中, 价值模型难以准确预测多步推理的最终奖励. 因为推理过程中的中间步骤可能看起来合理, 但最终答案却完全错误.

GRPO 的解决方案是组内相对评分: 对于同一个问题, 采样多个输出, 用它们之间的相对比较来计算优势, 而不是依赖价值模型的绝对预测.

Ai=ri−mean({r1,⋯ ,rG})std({r1,⋯ ,rG})A_i = \frac{r_i - \text{mean}(\{r_1, \cdots, r_G\})}{\text{std}(\{r_1, \cdots, r_G\})}

译者注: GRPO 的设计体现了 DeepSeek 团队对 RL 本质的深刻理解. 传统 PPO 的价值模型在短文本生成中工作良好, 因为部分响应可以较好地预测最终质量. 但在长思维链场景中, 模型可能在生成过程中进行反思和修正, 使得基于部分响应的预测几乎不可能. GRPO 通过「相对比较」绕开了这个难题, 这一思路后来被推广到所有需要长推理的场景.

3.3 迭代 RL 训练

DeepSeek-Math 采用迭代 RL 训练:

  1. 用当前模型生成大量推理轨迹.
  2. 过滤出答案正确的轨迹作为新的训练数据.
  3. 用新数据继续训练模型.
  4. 重复上述过程多轮.

这种自举(bootstrapping)方式使得模型可以逐步提升推理能力, 类似于 AlphaGo 的自我对弈.


4 性能与影响

基准 DeepSeek-Math 7B GPT-4 Minerva 540B
GSM8K 64.2% 92.0% 58.8%
MATH 36.2% 42.5% 33.6%
College Math 38.6% - -

DeepSeek-Math 7B 在多个数学基准上超越了 540B 的 Minerva, 证明了「领域数据 + 专门训练」可以弥补参数量的差距.

更重要的是, DeepSeek-Math 的探索直接影响了后续模型:

  1. GRPO: 成为 R1-Zero 和 R1 的核心 RL 算法.
  2. 迭代 RL: 启发了 R1 的多阶段训练流水线.
  3. 数学数据工程: 为 Qwen2.5-Math 等模型提供了方法论参考.

本文档为数理逻辑解码. 详细精译见《01-DeepSeek-Math技术报告精译.md》, GRPO 深入分析见《05-DeepSeek-Math-Mathematical-Reasoning.md》.