面向检索增强生成的更轻量且鲁棒的评估
计算与语言
2025-03-21 v1 人工智能
摘要
大型语言模型正促使我们从生成视角看待更多的 NLP 任务。同时,它们提供了一种新的访问信息的方式,主要通过 RAG 框架。尽管自回归模型取得了显著进展,但克服生成答案中的幻觉仍然是一个持续存在的问题。标准的解决方案是使用商业 LLM(如 GPT4)来评估这些算法。然而,此类框架昂贵且不够透明。因此,我们提出一项研究,展示开放权重模型在评估 RAG 幻觉方面的价值。我们开发了一种轻量级方法,使用较小的、量化的 LLM 来提供一种可访问且可解释的指标,该指标根据生成答案的正确性和忠实度为其提供连续评分。该评分使我们能够质疑决策的可靠性,并探索阈值以开发一种新的 AUC 指标,作为与人类判断相关性的替代方案。
引用
@article{arxiv.2503.16161,
title = {Towards Lighter and Robust Evaluation for Retrieval Augmented Generation},
author = {Alex-Razvan Ispas and Charles-Elie Simon and Fabien Caspani and Vincent Guigue},
journal= {arXiv preprint arXiv:2503.16161},
year = {2025}
}
备注
17 pages, 5 figures, published at 1st workshop of Quantify Uncertainty and Hallucination in Foundation Models: The Next Frontier in Reliable AI at ICLR 25