中文

超越下一个 token 概率:基于 LLM 输出分布的可学习、快速检测幻觉与数据污染方法

机器学习 2025-10-01 v3

摘要

大语言模型 (LLM) 输出中幻觉与训练数据污染的自动检测,是确保其安全部署的关键。在没有访问模型内部信息的情况下,这类任务尤为具有挑战性。现有方法通常仅利用文本中实际 token 的概率,依赖简单且特定于任务的启发式方法,忽略了完整的下一个 token 概率分布序列所包含的信息。我们提出通过学习 LLM 完全可观测输出——不仅包括下一个 token 的概率,还包括完整的下一个 token 分布序列——来超越手工制定的决策规则。我们将其称为 LLM 输出签名 (LLM Output Signature, LOS),并将其作为检测幻觉与数据污染的参考数据类型。为此,我们引入 LOS-Net,一个轻量级基于注意力机制的架构,通过对 LOS 的高效编码进行训练,能够在可证明的方式下近似已有技术在两个任务上的表现。实验结果表明,LOS-Net 在多样化基准和 LLM 上均实现了优异的性能,同时保持极低的检测延迟。此外,它在数据集和 LLM 之间展现出有前景的迁移能力。完整代码已公开于 https://github.com/BarSGuy/Beyond-next-token-probabilities。

关键词

引用

@article{arxiv.2503.14043,
  title  = {Beyond Next Token Probabilities: Learnable, Fast Detection of Hallucinations and Data Contamination on LLM Output Distributions},
  author = {Guy Bar-Shalom and Fabrizio Frasca and Derek Lim and Yoav Gelberg and Yftah Ziser and Ran El-Yaniv and Gal Chechik and Haggai Maron},
  journal= {arXiv preprint arXiv:2503.14043},
  year   = {2025}
}