语言模型是否反映了人类的自信心?探索心理学洞见以应对 LLM 中的过度自信问题
人工智能
2025-07-29 v2
摘要
心理学研究表明,人类在估计自己在任务上的表现时表现不佳,倾向于在简单任务上不自信,在困难任务上过度自信。我们在一系列难度各异的 QA 任务上考察了三个 LLM:Llama-3-70B-instruct、Claude-3-Sonnet 和 GPT-4o,结果表明模型与人类的过度自信模式存在细微差异:对任务难度较不敏感;当被提示基于不同角色(例如专家与外行,或不同种族、性别和年龄)作答时,尽管其底层答案准确率保持不变,模型会给出带有刻板印象偏见的置信度估计。基于这些观察,我们提出了无答案置信度估计 (AFCE),以在这些设置下改善置信度校准和 LLM 可解释性。AFCE 是一种自我评估方法,采用两阶段提示,首先仅引出问题的置信度分数,然后单独询问答案。在涵盖多个学科和难度的 MMLU 和 GPQA 数据集上的实验表明,这种任务分离显著减少了过度自信,并表现出更接近人类的对任务难度的敏感性。
引用
@article{arxiv.2506.00582,
title = {Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMs},
author = {Chenjun Xu and Bingbing Wen and Bin Han and Robert Wolfe and Lucy Lu Wang and Bill Howe},
journal= {arXiv preprint arXiv:2506.00582},
year = {2025}
}
备注
Accepted by ACL 2025 Findings, 20 pages