我认识这个实体吗?语言模型中的知识感知与幻觉
计算与语言
2025-02-11 v2 人工智能
机器学习
摘要
大语言模型中的幻觉是一个普遍问题,但关于模型是否会幻觉的机制仍未被充分理解,这限制了解决该问题的进展。利用稀疏自编码器作为可解释性工具,我们发现实体识别是这些机制的关键部分,即模型判断某个实体是否是其能回忆事实的对象。稀疏自编码器在表示空间中识别出有意义的方向,这些方向能检测模型是否识别某个实体,例如检测它是否不了解某个运动员或电影。这表明模型可能具有自我知识:关于自身能力的内部表征。这些方向具有因果相关性:它们能够引导模型拒绝回答关于已知实体的问题,或对未知实体产生幻觉属性。我们证明,尽管稀疏自编码器是在基础模型上训练的,但这些方向对聊天模型的拒绝行为具有因果影响,这表明聊天微调重新利用了这一现有机制。此外,我们对这些方向在模型中的机制作用进行了初步探索,发现它们会干扰通常将实体属性移动到最终token的注意力头。
关键词
引用
@article{arxiv.2411.14257,
title = {Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models},
author = {Javier Ferrando and Oscar Obeso and Senthooran Rajamanoharan and Neel Nanda},
journal= {arXiv preprint arXiv:2411.14257},
year = {2025}
}
备注
Accepted at ICLR 2025