中文

多轮训练结合基础人类反馈对大语言模型推理帮助甚微

计算与语言 2025-10-28 v2 信息论 机器学习 math.IT

摘要

大型语言模型(LLM)的推理能力通常通过单轮强化学习来开发,而现实应用中常涉及与人类反馈的多轮交互,导致训练与部署条件之间存在潜在的偏差。本文研究了多轮训练结合人类反馈是否对推理任务至关重要。我们比较了常规的单轮训练与三种多轮策略,得出了与前期研究相反的结论。我们发现,在单轮设置下训练的模型能够有效泛化至单轮和多轮评估,而采用多轮策略训练的模型在单轮推理性能上会显著下降。这些结果表明,对于信息完整的任务,稳健的单轮训练仍然更有效且可靠,因为多轮训练结合基础反馈的益处有限,甚至可能损害推理能力。

关键词

引用

@article{arxiv.2510.21339,
  title  = {Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning},
  author = {Qiang Liu and Wuganjing Song and Zhenzhou Lin and Feifan Chen and Qiaolong Cai and Chen Li and Yongduo Sui},
  journal= {arXiv preprint arXiv:2510.21339},
  year   = {2025}
}