HaloScope:利用无标签 LLM 生成内容检测幻觉
机器学习
2024-09-27 v1 计算与语言
摘要
大语言模型(LLM)的应用日益增长,引发对生成误导性或虚构信息(即幻觉)的关注。因此,检测幻觉对于维护对 LLM 生成内容的信任至关重要。学习真实性分类器的主要挑战是缺乏大量标记的真实与幻觉数据。为此,我们引入 HaloScope,一种新型学习框架,利用野外无标签 LLM 生成内容进行幻觉检测。此类无标签数据可在 LLM 部署于开放世界时免费获得,包含真实与幻觉信息。为充分利用无标签数据,我们提出了一种自动成员估计得分,用于区分无标签混合数据中的真实与不实生成内容,从而实现在其上训练二进制真实性分类器。重要的是,我们的框架无需额外数据收集和人工标注,具备强大的灵活性和实际应用性。广泛实验表明,HaloScope 能实现出色的幻觉检测性能,显著优于竞争对手。代码已公开于 https://github.com/deeplearningwisc/haloscope。
引用
@article{arxiv.2409.17504,
title = {HaloScope: Harnessing Unlabeled LLM Generations for Hallucination Detection},
author = {Xuefeng Du and Chaowei Xiao and Yixuan Li},
journal= {arXiv preprint arXiv:2409.17504},
year = {2024}
}
备注
NeurIPS 2024 Spotlight