中文

LLM激活中幻觉的弱监督检测

机器学习 2023-12-06 v1 计算与语言

摘要

我们提出了一种审计方法,用于识别大型语言模型(LLM)是否在其内部状态中编码了诸如幻觉之类的模式,这些模式可能会传播到下游任务。我们引入了一种弱监督审计技术,使用子集扫描方法来检测预训练模型LLM激活中的异常模式。重要的是,我们的方法不需要先验地知道模式的类型。相反,它在测试期间依赖于一个无异常的参考数据集。此外,我们的方法能够识别负责编码这些模式的关键节点,这可能为微调特定子网络以减轻偏差提供关键见解。我们引入了两种新的扫描方法来处理LLM激活,以检测可能在任何方向上偏离预期分布的异常句子。我们的结果证实了先前关于BERT编码幻觉的内部能力有限的发现,而OPT似乎能够在内部编码幻觉信息。重要的是,我们的扫描方法在没有事先接触虚假陈述的情况下,其性能与完全监督的分布外分类器相当。

关键词

引用

@article{arxiv.2312.02798,
  title  = {Weakly Supervised Detection of Hallucinations in LLM Activations},
  author = {Miriam Rateike and Celia Cintas and John Wamburu and Tanya Akumu and Skyler Speakman},
  journal= {arXiv preprint arXiv:2312.02798},
  year   = {2023}
}