中文

通过有据归因与学会拒绝衡量并提升 RAG 中 LLM 的可信度

计算与语言 2025-04-25 v4

摘要

大语言模型 (LLMs) 是检索增强生成 (RAG) 系统的核心组成部分。尽管许多研究侧重于评估端到端 RAG 系统的整体质量,但在理解 LLM 对 RAG 任务的适配性方面仍存在空白。为此,我们引入了 Trust-Score,一个用于评估 RAG 框架内 LLM 可信度的整体性指标。我们的结果表明,以 Trust-Score 衡量,诸如上下文学习等多种提示方法未能有效使 LLM 适应 RAG 任务。因此,我们提出了 Trust-Align,一种对齐 LLM 以提升 Trust-Score 性能的方法。使用 Trust-Align 对齐的 27 个模型中有 26 个在 ASQA、QAMPARI 和 ELI5 数据集上显著优于竞争基线。具体而言,在 LLaMA-3-8b 上,Trust-Align 在 ASQA(提升 12.56)、QAMPARI(提升 36.04)和 ELI5(提升 17.69)上均优于 FRONT。Trust-Align 还显著增强了模型正确拒绝回答和提供高质量引用的能力。我们还证明了 Trust-Align 在不同开源权重模型上的有效性,包括 LLaMA 系列(1b 至 8b)、Qwen-2.5 系列(0.5b 至 7b)以及 Phi3.5(3.8b)。我们在 https://github.com/declare-lab/trust-align 上发布了代码。

关键词

引用

@article{arxiv.2409.11242,
  title  = {Measuring and Enhancing Trustworthiness of LLMs in RAG through Grounded Attributions and Learning to Refuse},
  author = {Maojia Song and Shang Hong Sim and Rishabh Bhardwaj and Hai Leong Chieu and Navonil Majumder and Soujanya Poria},
  journal= {arXiv preprint arXiv:2409.11242},
  year   = {2025}
}

备注

Published at ICLR 2025 (Oral)