训练指挥中心 · 七期
Qwen2.5-Math-7B 底座 + GRPO + majority voting · 分支 math-base
自动刷新 15s训练中
全流程 · GRPO 训练中 step 124/300
✓
数据就绪
GSM8K 7473 + MATH×5
✓
底座基线
pass@1 + maj@8
GRPO 训练
300 步 · 混合quiz选模
冻结尺终审
双口径判决
🎓 训练方案架构馆 · 七代方案对照(点击切换,当前方案已标注)
换底座 + GRPO + maj@K
六期结论的正面回应:底座才是瓶颈,管线是资产branchmath-base↗train_grpo_mathbase.py + benchmark_majority.py底座: Qwen2.5-Math-7B-Instruct(★数学特化版——七期唯一变量)
架构组件与数据流
Qwen2.5-Math-7B
数学特化底座(裸考~80)
参照模型
冻结
sympy 判分
三期管线原封复用
majority voting
maj@8 测试时计算
混合课程
同三期配比
混合课程→Qwen2.5-Math-7BG=8
Qwen2.5-Math-7B→sympy 判分GRPO 训练
参照模型→Qwen2.5-Math-7BKL
Qwen2.5-Math-7B→majority voting评测: 同题 8 采样投票
训练 Flow(一个 step)
1. 底座基线
pass@1 + maj@8 双口径
2. GRPO 训练
300 步·三期同参
3. 冻结尺终审
pass@1 与历代可比
4. maj@8 增益
测试时计算单独计量
终审判词
进行中——底座基线 MATH 首段滚动 60%(通用版 48.5)
📚 核心知识点(实战验证)
- ▸数学特化底座=数学语料继续预训练——正是六期缺的'预训练量级注入'
- ▸majority voting:同题采 K 份取众数——推理时多花算力比训练时更划算(o1/R1 时代核心洞察)
- ▸单变量归因:管线/数据/评测全锁定,只换底座——'换对底座值多少分'一目了然
- ▸双口径纪律:pass@1 保持历代可比性,maj@K 的增益单独计量不混入
📦 数据块
训练=train split / 评测=test split(官方切分零重叠,无泄漏)训练数据配方
底座
Qwen/Qwen2.5-Math-7B-Instruct(数学特化底座,MATH 官方报告 ~80%)
GSM8K train
小学应用题——防遗忘的锚(六期教训:纯MATH数据 GSM8K -8pp)
MATH-500 ×5 上采样
竞赛题主粮,浓度 25%(三期配比)
评测套件(尺子与教材分离)
随堂测
每 25 步,rank 分片,混合分选 best_model
冻结尺终审
历代同尺,pass@1 口径
majority voting
测试时计算增益,七期新增口径
🔥 训练块
math-base-grpo · Qwen/Qwen2.5-Math-7B-Instructstep 124 / 300剩余约 10.3 小时
x
Pod
mathbase-grpo-pipeline-7kshh (9h)
最近 checkpoint
尚无
best_model(混合尺)
尚无
最近异常
无 ✓
🐕 step 120: ✓ max_delta=1.91e-04
训练 loss
随堂测(GSM8K 青 / MATH 琥珀)
KL 缰绳
reward / reward_std
completion 长度(截断哨)
🎯 训练后测试块
基线 → 终审 → 历期对照底座 MATH(pass@1)
…
通用版基线 48.5%
底座 MATH(maj@8)
…
测试时计算增益
底座 GSM8K(pass@1)
…
通用版基线 89.4%
训后终审
待训练完成
冻结尺 + maj@8 双口径
历期 MATH 战绩(绿虚线 = 七期目标 70)
六期迭代史(冻结尺)
| 期 | 方法 | GSM8K | MATH |
|---|---|---|---|
| 基线 | 出厂状态 — | 89.4 | 48.5 |
| 一期 | PPO + RM(distilabel) ±0 天花板效应 | 89 | 48.5 |
| 二期 | PPO + RM(Fable偏好对) 截断×RM合谋 -3pp | 90 | 45.5 |
| 三期 | GRPO + sympy判分 GSM8K新高,MATH回基线 | 91.2 | 48.5 |
| 四期 | GRPO + 沙箱执行reward 行为迁移成功,思路墙 | 79.2 | 48 |
| 五期 | MultiTurn GRPO + 自修 自修真实但无净增益 | 71.8 | 46 |
| 六期 | QLoRA SFT × 7385详解 风格学会,本征值不动(#40格式事故) | 81.4 | 47.5 |
🖥 环境块
硬件 · 软件栈 · 可观测🧭 资源驾驶舱(GPU/CPU/内存轮转盘 · 多节点自适应)
g5.24xlargeip-10-0-199-245.ec2.internal
99%
GPU 均值
4 卡
68%
显存均值
22G/卡
4%
CPU
node-exporter
4%
内存
node-exporter
99%
GPU0
15.5G · 70°C
99%
GPU1
15.2G · 67°C
99%
GPU2
15.2G · 66°C
98%
GPU3
15.5G · 66°C
⌨️ GPU 快捷终端(白名单命令 · kubectl exec 直出结果)
点击上方命令按钮,在训练 Pod 内执行并直出结果 ▸
🔭 可观测入口(点击直达 · port-forward 守护常驻)Grafana:3000 已连接Prometheus:9090 已连接
硬件与基础设施
GPU 实例
g5.24xlarge(4× NVIDIA A10G 24GB, us-east-1f)
互联
PCIe ~64GB/s(无 NVLink)
编排
AWS EKS 1.30/1.31 · nodegroup gpu-g5-1f(容量预留锁货)
存储
EFS(checkpoint/模型/数据)+ S3(归档)
软件框架栈
训练框架
trl 0.15.2 GRPOTrainer + transformers 4.48.3
分布式
accelerate 1.3.0 · DDP 4 rank
微调
QLoRA(peft 0.14, NF4 4bit + LoRA r16/α32 七投影全挂)
内核
torch 2.3.0 + flash-attention 2.6.3 + bitsandbytes 0.45
判分
sympy 符号判等(数值→符号→字符串三级)
镜像
ECR 分层(base 14GB + app 秒级迭代)· digest+tag 双固定
可观测体系
指标
wandb(训练曲线)+ Prometheus/Grafana/DCGM(GPU)
日志
Fluent Bit → CloudWatch(Pod 死后尸检的唯一入口)
本舱
collect.sh 30s 采集 → 文件即接口 → RSC 直读