LLM激活中幻觉的弱监督检测
机器学习
2023-12-06 v1 计算与语言
摘要
我们提出了一种审计方法,用于识别大型语言模型(LLM)是否在其内部状态中编码了诸如幻觉之类的模式,这些模式可能会传播到下游任务。我们引入了一种弱监督审计技术,使用子集扫描方法来检测预训练模型LLM激活中的异常模式。重要的是,我们的方法不需要先验地知道模式的类型。相反,它在测试期间依赖于一个无异常的参考数据集。此外,我们的方法能够识别负责编码这些模式的关键节点,这可能为微调特定子网络以减轻偏差提供关键见解。我们引入了两种新的扫描方法来处理LLM激活,以检测可能在任何方向上偏离预期分布的异常句子。我们的结果证实了先前关于BERT编码幻觉的内部能力有限的发现,而OPT似乎能够在内部编码幻觉信息。重要的是,我们的扫描方法在没有事先接触虚假陈述的情况下,其性能与完全监督的分布外分类器相当。
引用
@article{arxiv.2312.02798,
title = {Weakly Supervised Detection of Hallucinations in LLM Activations},
author = {Miriam Rateike and Celia Cintas and John Wamburu and Tanya Akumu and Skyler Speakman},
journal= {arXiv preprint arXiv:2312.02798},
year = {2023}
}