用于幻觉检测的度量集成方法
计算与语言
2023-10-17 v1
摘要
近来,抽象文本摘要引起了越来越多的关注,部分原因是大语言模型(LLM)的激增。与生成抽象摘要相关的最紧迫问题之一是亟需减少“幻觉”——即未被纳入所摘要文档且可能完全错误的信息。出于这一需求,人们提出了大量估计与所摘要文本一致性的度量指标。我们特别考察了一套用于摘要一致性的无监督度量,并测量它们在 wiki_bio_gpt3_hallucination 数据集中彼此之间以及与人类评估分数的相关性。随后,我们将这些评估与由这些度量的简单线性集成所构建的模型进行比较。我们发现,基于 LLM 的方法在无监督幻觉检测度量中优于其他方法。我们还发现,只要集成中的度量具有足够相似且不相关的错误率,集成方法就能进一步改善这些分数。最后,我们提出了一种基于 LLM 评估的集成方法,表明其优于先前的 SOTA。
引用
@article{arxiv.2310.10495,
title = {Metric Ensembles For Hallucination Detection},
author = {Grant C. Forbes and Parth Katlana and Zeydy Ortiz},
journal= {arXiv preprint arXiv:2310.10495},
year = {2023}
}
备注
9 pages, 5 figures