中文

超越精确:面向长文本LLM生成的重要性感知召回事实性评估

计算与语言 2026-04-06 v1

摘要

评估大型语言模型(LLM)生成的长文本输出的事实性仍然具有挑战性,尤其是当响应开放且包含大量细粒度事实陈述时。现有的评估方法主要关注精确度:将响应分解为原子命题,并根据维基百科等外部知识源进行验证。然而,这忽略了事实性的同样重要维度:召回度,即生成响应是否覆盖了应包含的相关事实。我们提出了综合性的事实性评估框架,联合衡量精确度和召回度。我们利用外部知识源构建参考事实,并确定它们是否包含在生成文本中。我们进一步引入基于相关性和显著性的重要性感知加权方案。我们的分析表明,当前LLM在精确度上表现显著优于召回度,这表明长文本生成的事实完整性仍是一个主要局限,而模型在覆盖高度重要的事实方面通常优于完整的相关事实集合。

关键词

引用

@article{arxiv.2604.03141,
  title  = {Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation},
  author = {Nazanin Jafari and James Allan and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2604.03141},
  year   = {2026}
}