基于表示的广义幻觉检测器无法泛化到分布外数据
机器学习
2025-09-25 v1 人工智能
摘要
我们批判性地评估了当前最先进(SOTA)幻觉检测方法的有效性,并发现其在 RAGTruth 数据集上的性能很大程度上是由与数据的虚假相关性驱动的。在控制此效应后,最先进方法的性能并不优于有监督的线性探针,同时还需要跨数据集进行大量的超参数调优。分布外泛化目前无法实现,所有被分析的方法的性能都接近随机水平。我们为幻觉检测及其评估提出了一套指导原则。
引用
@article{arxiv.2509.19372,
title = {Representation-based Broad Hallucination Detectors Fail to Generalize Out of Distribution},
author = {Zuzanna Dubanowska and Maciej Żelaszczyk and Michał Brzozowski and Paolo Mandica and Michał Karpowicz},
journal= {arXiv preprint arXiv:2509.19372},
year = {2025}
}
备注
Accepted in EMNLP 2025 Findings