中文

从顽石中发掘瑰宝:面向 LLM 推理的负样本增强策略优化

人工智能 2025-09-16 v4 机器学习

摘要

推理语言模型的最新进展见证了从短 CoT 到长 CoT 模式的范式转变。鉴于长 CoT 模型中 rollout 的巨大计算开销,最大化固定训练数据集的利用率变得至关重要。我们的分析表明,负向响应包含诸如自我反思和纠错步骤等有价值的成分,然而现有的主要方法要么完全丢弃负样本(RFT),要么对所有 token 施加同等惩罚(RL),未能利用这些潜在的学习信号。有鉴于此,我们提出了带有负样本增强的行为约束策略梯度(Behavior Constrained Policy Gradient with Negative Sample Augmentation, BCPG-NSA),这是一个细粒度的离线 RL 框架,包含三个阶段:1)样本分割,2)结合 LLM 和 PRM 评判器的基于共识的步骤正确性评估,以及 3)旨在有效挖掘负样本中正向步骤的 NSA 策略优化。实验结果表明,在使用相同训练数据集的情况下,BCPG-NSA 在多个具有挑战性的数学/编码推理基准上优于基线方法,实现了更高的样本效率,并在扩展至多次迭代时展现出鲁棒性和可扩展性。

关键词

引用

@article{arxiv.2505.14403,
  title  = {Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning},
  author = {Zhaohui Yang and Yuxiao Ye and Shilei Jiang and Chen Hu and Linjing Li and Shihong Deng and Daxin Jiang},
  journal= {arXiv preprint arXiv:2505.14403},
  year   = {2025}
}