了解事实却选择捷径:理解大型语言模型如何比较实体
计算与语言
2026-01-27 v2 人工智能
摘要
大型语言模型(LLMs)日益用于基于知识的推理任务,但仍然难以理解它们何时依赖真实知识而非浅层启发式方法。我们通过实体比较任务来调查此问题,通过询问模型沿着数值属性比较实体(例如,"哪条河更长,达吉河或尼罗河?"),这些问题为系统分析提供明确的真实答案。尽管模型拥有足够的数值知识以正确回答,但LLMs经常会做出与知识相矛盾的预测。我们识别出三个强烈影响模型预测的启发式偏差:实体流行度、提及顺序和语义共现。对于较小的模型,仅使用这些表面线索的简单逻辑回归比模型自身的数值预测更准确地预测模型选择,表明启发式方法在主导原则推理方面占主导地位。关键的是,我们发现较大的模型(320亿参数)在可靠性更高时选择性地依赖数值知识,而较小的模型(7-8亿参数)表现出不区分此类情况的现象,这解释了为何较大的模型即使较小的模型拥有更准确的知识也能表现更好。链式思考提示会引导所有模型在所有模型规模上都使用数值特征。
引用
@article{arxiv.2510.16815,
title = {Knowing the Facts but Choosing the Shortcut: Understanding How Large Language Models Compare Entities},
author = {Hans Hergen Lehmann and Jae Hee Lee and Steven Schockaert and Stefan Wermter},
journal= {arXiv preprint arXiv:2510.16815},
year = {2026}
}
备注
34 pages, 20 figures. Accepted for EACL 2026