语言模型非事实性幻觉的机理理解与缓解
计算与语言
2024-06-19 v2 人工智能
摘要
面向时代语言模型(LMs)有时会生成与世界知识不对齐的非事实性幻觉。为探索这些幻觉的机理原因,我们创建了包含主体-关系查询的诊断数据集,并改进可解释性方法以追踪模型内部表示中的幻觉。我们发现跨LMs(Llama-2、Pythia、GPT-J)共享的两种通用且不同的幻觉机理:1) 知识丰富化幻觉:较低层MLP中主体属性知识不足,2) 答案提取幻觉:在较高层注意力头中选择正确对象属性失败。我们也发现,这两种内部幻觉机理在外部表现形式中得到反映。基于我们的机理分析,我们提出一种通过针对性恢复 LM内部事实记忆管道的新型幻觉缓解方法,显示出优于基线的优异性能。
引用
@article{arxiv.2403.18167,
title = {Mechanistic Understanding and Mitigation of Language Model Non-Factual Hallucinations},
author = {Lei Yu and Meng Cao and Jackie Chi Kit Cheung and Yue Dong},
journal= {arXiv preprint arXiv:2403.18167},
year = {2024}
}