解析 LLM 内在自我纠正的黑色面孔
计算与语言
2025-07-16 v2
摘要
内在自我纠正通过仅基于其内在能力的反馈提示词来提高 LLM 的响应能力。然而,近期研究表明,在没有 oracle 标签作为反馈提示词的情况下,LLM 的内在自我纠正会失败。本文旨在解释不同任务中 LLM 内在自我纠正的工作机制,尤其是针对这些失败案例。我们设计了包括一个简单任务和三个复杂任务的情境,涵盖最先进的 LLM 如 ChatGPT 系列(o1、4o、3.5-turbo)和 Llama 系列(2-7B、3-8B、3.1-8B),并通过三种解释方法揭示 LLM 内在自我纠正的黑色面孔。我们识别出内在自我纠正会(1)导致 LLM 在中间答案和最终答案之间反复徘徊,并在简单事实性问题上引发提示偏差;(2)在复杂任务中引入类人认知偏见。鉴于我们的发现,我们还提供两种简单且有效的缓解策略:问题重复和使用少量样本进行监督微调。我们在 https://x-isc.info/ 上开源了本项目。
引用
@article{arxiv.2412.14959,
title = {Understanding the Dark Side of LLMs' Intrinsic Self-Correction},
author = {Qingjie Zhang and Di Wang and Haoting Qian and Yiming Li and Tianwei Zhang and Minlie Huang and Ke Xu and Hewu Li and Yan Liu and Han Qiu},
journal= {arXiv preprint arXiv:2412.14959},
year = {2025}
}