中文

面向生成文本的细粒度引用评估:信实性指标的比较分析

信息检索 2024-08-26 v2 计算与语言

摘要

大型语言模型 (LLM) 常常产生不受支持或不可验证的内容,称为“幻觉”。为缓解这一问题,检索增强型 LLM 纳入引用,将内容 grounding 在可验证的来源上。尽管存在这类发展,但手动评估引用是否支持相关声明仍是主要挑战。以往研究使用信实性指标来自动估计引用支持,但仅限于二元分类,忽略了实际场景中细粒度引用支持。为调查信实性指标在细粒度场景中的有效性,我们提出了一个比较评估框架,用于评估指标在区分三个类别支持水平(完全支持、部分支持和无支持)方面的效果。我们的框架采用相关性分析、分类评估和检索评估来全面衡量指标得分与人类判断之间的对齐程度。我们的结果显示,没有单一指标在所有评估中都表现突出,揭示了评估细粒度支持的复杂性。基于这些发现,我们提供了用于开发更有效指标的实用建议。

关键词

引用

@article{arxiv.2406.15264,
  title  = {Towards Fine-Grained Citation Evaluation in Generated Text: A Comparative Analysis of Faithfulness Metrics},
  author = {Weijia Zhang and Mohammad Aliannejadi and Yifei Yuan and Jiahuan Pei and Jia-Hong Huang and Evangelos Kanoulas},
  journal= {arXiv preprint arXiv:2406.15264},
  year   = {2024}
}

备注

Accepted by the 17th International Natural Language Generation Conference (INLG 2024) as an oral presentation