当后见之明并非完美:测试大型语言模型反思思维的极限
计算与语言
2024-04-16 v1
摘要
最近的研究表明,自我反思提示可以显著增强大型语言模型(LLM)的推理能力。然而,使用外部反馈作为停止标准引发了对LLM模拟人类自我反思能力的真实程度的质疑。在本文中,我们旨在更严格的评估环境下阐明这些能力,不允许任何形式的外部反馈。在这种设置下,我们的发现显示出分歧:虽然自我反思在TruthfulQA中提升了性能,但在HotpotQA中却产生了负面影响。我们进行了后续分析以阐明这些模式中的贡献因素,发现自我反思的影响既受到模型初始响应准确率可靠性的影响,也受到整体问题难度的影响:具体来说,当模型最初正确的可能性较低且整体问题难度较高时,自我反思显示出最大的益处。我们还发现自我反思降低了多数投票的倾向。基于我们的发现,我们提出了关于何时实施自我反思的决策指南。我们发布了用于复现实验的代码库:https://github.com/yanhong-lbh/LLM-SelfReflection-Eval。
引用
@article{arxiv.2404.09129,
title = {When Hindsight is Not 20/20: Testing Limits on Reflective Thinking in Large Language Models},
author = {Yanhong Li and Chenghao Yang and Allyson Ettinger},
journal= {arXiv preprint arXiv:2404.09129},
year = {2024}
}
备注
NAACL 2024 Findings paper (Camera-Ready Version)