ReNCE:通过噪声对比估计学习推理
机器学习
2026-02-02 v1 计算与语言
摘要
GRPO 是为预训练大语言模型赋予推理能力的标准方法。它估计来自 K 个结果组中单个结果的优势,并在信任区域内推广那些具有正优势的结果。由于 GRPO 对好坏结果进行软性区分,受益于诸如非对称裁剪和零方差数据过滤等额外的改进。虽然这些改进有效,但需要大量经验洞察且难以识别。我们提出一种显式的对比学习方法。我们将 K 个结果划分为正负两个集合,然后最大化正结果的似然。我们的做法可视为 LLM 推理的在线多标签噪声对比估计实例。我们通过在一系列具有挑战性的数学基准测试上进行验证,展示了我们方法与 DAPO 和在线 DPO 等强大基线之间的竞争性能。
引用
@article{arxiv.2601.22432,
title = {ReNCE: Learning to Reason by Noise Contrastive Estimation},
author = {Wenzheng Zhang and Karl Stratos},
journal= {arXiv preprint arXiv:2601.22432},
year = {2026}
}