CoScale-RL:通过协比例扩大数据与计算实现高效后训练
机器学习
2026-01-22 v1 人工智能
摘要
训练大型推理模型(LRM)通常不稳定且难以预测,尤其是在解决困难问题或基础模型较弱的情况下。我们发现,当前的后训练比例扩大策略在这些场景仍可取得改进。我们提出了CoScale-RL,这是一种数据与计算效率更佳的新型比例扩大策略。我们首先扩展解决方案以使问题可求解。核心思想是为每个问题收集多个解决方案,而非仅简单扩大数据集。随后,我们扩展 rollout 计算以稳定强化学习。我们进一步利用一种称为 Re-distillation 的模型融合技术,在扩大计算时维持或甚至提升计算效率。我们的方法在数据和计算效率上显著提升,在四个基准上平均提升了3.76倍的准确率。CoScale-RL能够在无需大量 SFT 数据集的情况下提升 LRM 的能力边界。我们的方法为进一步提升 LRM 推理能力提供了新的比例扩大方向。
引用
@article{arxiv.2601.14695,
title = {CoScale-RL: Efficient Post-Training by Co-Scaling Data and Computation},
author = {Yutong Chen and Jiandong Gao and Ji Wu},
journal= {arXiv preprint arXiv:2601.14695},
year = {2026}
}
备注
preprint