中文

引用评估中可信度指标与人类的比较分析

信息检索 2024-08-23 v1 计算与语言

摘要

大型语言模型 (LLM) 常生成不受支持或不可验证的内容,称为“幻觉”。为解决此问题,采用检索增强型 LLM 可在内容中加入引用,将内容锚定在可验证的来源上。尽管如此,手动评估引用是否支持其关联陈述仍是主要挑战。以往研究通过利用可信度指标来自动估计引用支持,但仅限于二元分类场景,忽略了实际场景中引用支持的细粒度评估。为探讨可信度指标在细粒度场景中的有效性,我们提出了比较评估框架,评估指标在区分引用三类支持水平(完全支持、部分支持、无支持)方面的效果。该框架综合采用相关性分析、分类评估和检索评估来衡量指标分数与人类判断之间的对齐程度。我们的结果表明,没有单一指标在所有评估中均表现突出,凸显准确评估细粒度支持水平的复杂性。特别地,我们发现最佳指标在区分部分支持与完全支持或无支持方面仍存在困难。基于这些发现,我们提供了实用建议,以指导更有效指标的开发。

关键词

引用

@article{arxiv.2408.12398,
  title  = {A Comparative Analysis of Faithfulness Metrics and Humans in Citation Evaluation},
  author = {Weijia Zhang and Mohammad Aliannejadi and Jiahuan Pei and Yifei Yuan and Jia-Hong Huang and Evangelos Kanoulas},
  journal= {arXiv preprint arXiv:2408.12398},
  year   = {2024}
}

备注

Accepted by the First Workshop on Large Language Model for Evaluation in Information Retrieval (LLM4Eval@SIGIR2024), non-archival. arXiv admin note: substantial text overlap with arXiv:2406.15264