面向 RAG 的实时评估模型:谁最能检测幻觉?
机器学习
2025-04-08 v3
摘要
本文调查了用于自动检测 RAG(检索增强生成)中幻觉的 Evaluation 模型,并对其在六个 RAG 应用中的性能进行了全面基准测试。我们研究的 Methods 包括:LLM-as-a-Judge、Prometheus、Lynx、Hughes Hallucination Evaluation Model(HHEM),以及 Trustworthy Language Model(TLM)。这些方法都是无参考方法,无需 ground-truth answers/labels 即可捕捉不正确的 LLM 回应。我们的研究揭示了,在多样化的 RAG 应用中,这些方法中一些方法在检测不正确的 RAG 回应方面具有较高的 precision/recall。
引用
@article{arxiv.2503.21157,
title = {Real-Time Evaluation Models for RAG: Who Detects Hallucinations Best?},
author = {Ashish Sardana},
journal= {arXiv preprint arXiv:2503.21157},
year = {2025}
}
备注
11 pages, 8 figures