文本生成中事实回忆的完整性度量标准
计算与语言
2026-05-11 v2
摘要
尽管大语言模型(LLMs)在广泛的任务中展现出惊人的性能,但也被发现经常产生不完整或有选择性地遗漏关键信息的输出。在敏感领域,此类遗漏可能导致与事实错误(包括幻觉)相当的严重危害。本研究聚焦于评估 LLM 生成文本的完整性,特别关注对缺失信息或不充分代表性观点的检测。我们检验了三种自动化评估度量标准:(1)基于 NLI 的方法将文本分解为原子语句,并利用自然语言推理(NLI)识别缺失事实;(2)基于 Q&A 的度量标准提取问答对并跨来源比较响应;(3)一种直接使用 LLM 识别缺失内容的端到端方法。我们的实验表明,尽管简单易行的端到端度量标准在效果上相当出色,但其鲁棒性、可解释性和结果细粒度性较差。我们进一步评估了来自多个流行开源 LLMs 在基于多个来源回答用户查询时的响应的完整性。
引用
@article{arxiv.2510.07926,
title = {Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation},
author = {Adam Dejl and James Barry and Alessandra Pascale and Javier Carnerero Cano},
journal= {arXiv preprint arXiv:2510.07926},
year = {2026}
}
备注
ACL 2026 Findings