中文

反馈摩擦:LLM 难以充分整合外部反馈

计算与语言 2025-09-23 v2

摘要

近期研究表明,LLM 在获得外部反馈时具备一定的改进其回答的能力。然而,这些模型能够多有效和多彻底地整合外部反馈仍不清楚。在理想情况下,如果 LLM 收到近乎完美且完整的反馈,我们期望它们能够完全整合反馈并得出正确解答。在本文中,我们通过设计受控实验环境,系统地研究了 LLM 整合反馈的能力。对于每个问题,求解模型尝试求解,然后一个能够访问近乎完整真实答案的反馈生成器生成针对性反馈,之后求解模型再次尝试。我们在广泛的任务上评估该流程,包括数学推理、知识推理、科学推理和通用多领域评估,使用最先进的语言模型,包括具有扩展思考能力的 Claude 3.7。令人惊讶的是,即使在这些近乎理想的条件下,求解模型始终表现出对反馈的抗拒,我们将这一局限性称为反馈摩擦。为了缓解这一局限性,我们实验了基于采样的策略,如渐进式温度升高和显式拒绝先前尝试的错误答案,这些策略带来了改进,但仍未能帮助模型达到目标性能。我们分析了反馈摩擦,发现模型对特定问题的置信度(以语义熵衡量)可以预测反馈抗拒性:高置信度预测仍然抗拒外部纠正。我们希望强调 LLM 中的这一问题将有助于自我提升的未来研究。

关键词

引用

@article{arxiv.2506.11930,
  title  = {Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback},
  author = {Dongwei Jiang and Alvin Zhang and Andrew Wang and Nicholas Andrews and Daniel Khashabi},
  journal= {arXiv preprint arXiv:2506.11930},
  year   = {2025}
}