Bián:检索增强生成中的幻觉检测的双语基准与模型
计算与语言
2025-02-27 v1
摘要
检索增强生成(RAG)有效地减少了大型语言模型(LLM)中的幻觉,但仍可能产生不一致或不受支持的内容。虽然LLM作为评判器在RAG幻觉检测中广泛使用,由于其实现简单,但面临两个主要挑战:缺乏全面的评估基准以及缺乏领域优化的评判器模型。为弥合这一差距,我们引入了\textbf{Bián}框架,这是一个包含双语基准数据集和轻量级评判器模型的新型框架。该数据集支持跨多个RAG情景的严格评估,而评判器模型则微调自紧凑开源LLM。在BiánBench上的大规模实验评估显示,我们的14B模型超越了参数规模超过五倍的基准模型,并与最先进的闭源LLM一道。我们将不久后在https://github.com/OpenSPG/KAG 上发布数据和模型。
引用
@article{arxiv.2502.19209,
title = {Bi'an: A Bilingual Benchmark and Model for Hallucination Detection in Retrieval-Augmented Generation},
author = {Zhouyu Jiang and Mengshu Sun and Zhiqiang Zhang and Lei Liang},
journal= {arXiv preprint arXiv:2502.19209},
year = {2025}
}