中文

文本生成中事实回忆的完整性度量标准

计算与语言 2026-05-11 v2

摘要

尽管大语言模型(LLMs)在广泛的任务中展现出惊人的性能,但也被发现经常产生不完整或有选择性地遗漏关键信息的输出。在敏感领域,此类遗漏可能导致与事实错误(包括幻觉)相当的严重危害。本研究聚焦于评估 LLM 生成文本的完整性,特别关注对缺失信息或不充分代表性观点的检测。我们检验了三种自动化评估度量标准:(1)基于 NLI 的方法将文本分解为原子语句,并利用自然语言推理(NLI)识别缺失事实;(2)基于 Q&A 的度量标准提取问答对并跨来源比较响应;(3)一种直接使用 LLM 识别缺失内容的端到端方法。我们的实验表明,尽管简单易行的端到端度量标准在效果上相当出色,但其鲁棒性、可解释性和结果细粒度性较差。我们进一步评估了来自多个流行开源 LLMs 在基于多个来源回答用户查询时的响应的完整性。

关键词

引用

@article{arxiv.2510.07926,
  title  = {Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation},
  author = {Adam Dejl and James Barry and Alessandra Pascale and Javier Carnerero Cano},
  journal= {arXiv preprint arXiv:2510.07926},
  year   = {2026}
}

备注

ACL 2026 Findings