基于演化版块榜的LLM在RAG中的忠诚度基准测试
计算与语言
2025-11-07 v2 人工智能
摘要
检索增强生成(RAG)旨在通过在响应中植入外部上下文来减少幻觉,但大型语言模型(LLM)仍经常在提供相关上下文后引入不受支持的信息或矛盾。本文介绍了Vectara为RAG中衡量和基准测试LLM忠诚度的两个互补努力。首先,我们描述了自2023年以来的原始幻觉版块榜,该版块榜使用我们的HHEM幻觉检测模型跟踪LLM的幻觉率。针对当前幻觉检测方法的局限性,我们引入FaithJudge,一个基于LLM的评判框架,利用多样化的人工标注幻觉示例的池子,显著提升了LLM在RAG中的幻觉评估。我们引入以FaithJudge为中心的增强版幻觉版块榜,对LLM在摘要生成、问答和数据到文本生成任务中的忠诚度进行基准测试。FaithJudge实现了对RAG中LLM幻觉的更可靠基准测试,支持开发更可信的生成式AI系统:https://github.com/vectara/FaithJudge。
关键词
引用
@article{arxiv.2505.04847,
title = {Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards},
author = {Manveer Singh Tamber and Forrest Sheng Bao and Chenyu Xu and Ge Luo and Suleman Kazi and Minseok Bae and Miaoran Li and Ofer Mendelevitch and Renyi Qu and Jimmy Lin},
journal= {arXiv preprint arXiv:2505.04847},
year = {2025}
}
备注
EMNLP Industry Track 2025