中文

通过带可验证准确性和放弃奖励的课程强化学习消除多轮对话中的信息丢失

计算与语言 2026-05-01 v3 人工智能 机器学习

摘要

大语言模型在单轮指令遵循方面表现出色,但在信息逐步揭示的多轮环境中表现下降,出现 Lost-in-Conversation(LiC)问题。鉴于当前在可验证奖励强化学习(RLVR)方面的进展,我们提出一种带可验证准确性和放弃奖励的课程强化学习框架(RLAAR),鼓励模型不仅生成正确答案,还判断在多轮对话环境中问题的可解性。我们的方法采用能力门控课程逐步增加对话难度(以指令碎片为度),在训练中稳定过程,同时促进可靠性。通过多轮、基于策略的 rollout 和混合奖励系统,RLAAR 教会模型在解决问题与自知放弃之间进行平衡,减少导致 LiC 的过早作答行为。在 LiC 基准测试上评估后,RLAAR 显著减轻了 LiC 性能衰减(从 62.6% 提升至 75.1%),并提高了校准的放弃率(从 33.5% 提升至 73.4%)。这些结果为构建可靠且值得信赖的多轮 LLM 提供了实用的方案。

关键词

引用

@article{arxiv.2510.18731,
  title  = {Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards},
  author = {Ming Li and Pei Chen and Zhenhao Zhang and Tao Yang and Xinyang Zhang and Han Li and Tianyu Cao and Ming Zeng and Zhuofeng Wu and Meng Jiang and Huasheng Li and Lihong Li and Bing Yin},
  journal= {arXiv preprint arXiv:2510.18731},
  year   = {2026}
}

备注

ACL2026, camera-ready