中文

评估基于无参考LLM指标的 grounding 文档实用性

计算与语言 2026-02-02 v1

摘要

检索增强生成(RAG)的成功取决于LLM从用于 grounding 的内容中所获益的实用性。量化内容实用性尚无确定规范,现有指标忽视模型特定能力和/或依赖高成本注释。在本文中,我们提出 grounding 生成实用性(GroGU),一种基于 LLM 生成置信度(基于熵)定义实用性的模型特定无参考指标。尽管无需注释要求,GroGU在区分真实文档方面基本忠实,同时捕捉LLM 非通用指标所忽略的细微差别。我们应用GroGU训练查询改写器,用于RAG,通过识别高实用性偏好数据进行 Direct Preference Optimization。实验显示,在平均倒数排名提升最高可达 18.2 分,在答案准确率提升最高可达 9.4 分。

关键词

引用

@article{arxiv.2601.23129,
  title  = {Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics},
  author = {Yilun Hua and Giuseppe Castellucci and Peter Schulam and Heba Elfardy and Kevin Small},
  journal= {arXiv preprint arXiv:2601.23129},
  year   = {2026}
}