中文

后训练算法是否真的不同?跨模型规模的受控研究揭示规模依赖的排序反转

机器学习 2026-03-23 v1 人工智能

摘要

后训练对齐已产生数十种竞争算法——DPO、SimPO、KTO、GRPO 等——但实践者缺乏受控比较以指导算法选择。我们提出 OXRL,一个统一框架实现 51 种后训练算法,采用相同的基础设施,实现首次大规模 apples-to-apples 评估。我们的研究覆盖 8 种算法跨 4 个模型规模(0.5B--7B),3 个评估领域,以及 20 种 DPO 变体(1.5B 上 100 次运行,5 个随机种子),总计约 240 次训练运行在 H100 GPU 上。三个主要发现浮现。(1)算法在规模间的排序不稳定:在 1.5B,online RL(SGRPO)以 58.0%±0.57 在 GSM8K 上居首;至 7B 时,最差的小规模方法(SimPO)反而成为最佳(85.8%),这是一种完全的排序反转,由模型规模而非 LoRA 正则化驱动(通过 2×2 因子实验确认)。(2)损失函数修改带来可忽略的收益:在 Bonferroni 校正后,20 种 DPO 变体中没有一种显著优于 vanilla DPO;唯一显著的异常值 SimPO 更差(-11.511.5 pp,p<104p < 10^{-4})。(3)算法杠杆具有任务相关性:19.3 pp 的 GSM8K 差距在 MATH(36×36\times)和通用领域基准(41×41\times)上压缩到 0.54 pp 和 0.47 pp,确认算法选择主要在训练分布内起作用。这些发现为实践者提供层级杠杆:模型规模({\sim}50 pp)\gg 训练范式({\sim}10 pp)\gg online vs. offline({\sim}9 pp)\gg 损失函数({\sim}1 pp)。我们发布所有代码、配置和评估数据作为活跃的社区基准。

关键词

引用

@article{arxiv.2603.19335,
  title  = {Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions},
  author = {Xiaoyi Li},
  journal= {arXiv preprint arXiv:2603.19335},
  year   = {2026}
}