中文

基于队列的一致性学习 (CC-LEARN)

计算与语言 2025-06-19 v1

摘要

大型语言模型在诸多任务上表现优异,但仍在一致性和稳健推理方面存在挑战。我们引入基于队列的一致性学习 (CC-Learn),这是一种强化学习框架,通过在由共享程序抽象派生的相似问题队列中进行训练来提高 LLM 推理的可靠性。为实现队列级一致性,我们定义了一个复合目标,包括队列准确率、对有效问题分解的检索奖励以及对平凡或无效查找的否定惩罚项,强化学习能够直接优化这些目标。优化该奖励指引模型在所有队列成员之间采用一致的推理模式。在包含 ARC-Challenge 和 StrategyQA 等具有挑战性的推理基准测试上进行实验,表明 CC-Learn 在预训练和 SFT 基准之上显著提升了准确率和推理稳定性。这些结果表明,队列级强化学习有效地增强了 LLM 的推理一致性。

关键词

引用

@article{arxiv.2506.15662,
  title  = {CC-LEARN: Cohort-based Consistency Learning},
  author = {Xiao Ye and Shaswat Shrivastava and Zhaonan Li and Jacob Dineen and Shijie Lu and Avneet Ahuja and Ming Shen and Zhikun Xu and Ben Zhou},
  journal= {arXiv preprint arXiv:2506.15662},
  year   = {2025}
}