推理链上的欺骗性语义捷径:模型能在无幻觉情况下走多远?
计算与语言
2024-04-09 v3 人工智能
摘要
尽管大语言模型(LLMs)近期取得进展且在众多基准上表现优异,近期研究揭示 LLMs 存在幻觉与不可靠推理。本文研究由语义关联引发的一类特定幻觉。具体而言,我们考察 LLMs 在多大程度上从提示中某些关键词/实体偏差走捷径,而非遵循正确推理路径。为量化此现象,我们提出一种称为 EureQA 的新型探测方法与基准。我们从 LLMs 以极高置信度正确回答的问题出发,递归地用证据句掩蔽重要实体,要求模型在回答问题前依据证据链找出被掩蔽的实体。在证据构建过程中,我们有意将可能导向正确答案的语义线索(实体)替换为干扰线索(证据),这些干扰线索不会直接导向正确答案,而需要类链的推理过程。我们评估模型是否能遵循正确推理链,而非通过干扰线索走捷径。我们发现现有 LLMs 缺乏遵循正确推理路径及抵御贪婪捷径尝试的必要能力。我们表明干扰性语义关联常导致模型幻觉,这强有力地质疑了当前 LLM 推理的有效性。
引用
@article{arxiv.2311.09702,
title = {Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?},
author = {Bangzheng Li and Ben Zhou and Fei Wang and Xingyu Fu and Dan Roth and Muhao Chen},
journal= {arXiv preprint arXiv:2311.09702},
year = {2024}
}
备注
Work accepted by NAACL 2024