多轮训练结合基础人类反馈对大语言模型推理帮助甚微
计算与语言
2025-10-28 v2 信息论
机器学习
math.IT
摘要
大型语言模型(LLM)的推理能力通常通过单轮强化学习来开发,而现实应用中常涉及与人类反馈的多轮交互,导致训练与部署条件之间存在潜在的偏差。本文研究了多轮训练结合人类反馈是否对推理任务至关重要。我们比较了常规的单轮训练与三种多轮策略,得出了与前期研究相反的结论。我们发现,在单轮设置下训练的模型能够有效泛化至单轮和多轮评估,而采用多轮策略训练的模型在单轮推理性能上会显著下降。这些结果表明,对于信息完整的任务,稳健的单轮训练仍然更有效且可靠,因为多轮训练结合基础反馈的益处有限,甚至可能损害推理能力。
引用
@article{arxiv.2510.21339,
title = {Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning},
author = {Qiang Liu and Wuganjing Song and Zhenzhou Lin and Feifan Chen and Qiaolong Cai and Chen Li and Yongduo Sui},
journal= {arXiv preprint arXiv:2510.21339},
year = {2025}
}