中文

测试长文档摘要事实一致性指标的鲁棒性

计算与语言 2026-04-30 v2 人工智能 机器学习

摘要

评估抽象文本摘要的事实一致性始终是一个重要挑战,尤其是在长文档场景中,由于输入长度限制和长程依赖问题,传统指标往往难以胜任。本文系统评估了六个广泛使用的无参考事实性指标在长文档设置下的可靠性。我们通过七种保持事实的扰动来探测指标的鲁棒性,这些扰动包括改写、简化、同义词替换、逻辑等价否定、词汇减少、压缩以及源文本插入,并进一步分析其对检索上下文和论点信息密度的敏感性。结果在三个覆盖科幻、法律和科学领域的长形式基准数据集上表明,现有的短形式指标会为在语义上等价的摘要产生不一致的评分,并在信息密集型论点上表现下降,这些论点的语义内容与源文档的许多部分相似。虽然扩大检索上下文在某些领域可提高稳定性,但没有任何指标在长上下文条件下都能持续保持事实一致性。最终,我们的结果指出了改进事实评估的具体方向,包括多跨段推理、上下文感知校准以及针对意义保持变体的训练,以增强长文档摘要中的鲁棒性。我们发布了所有代码、扰动数据以及复现结果所需的脚本,地址为 https://github.com/zainmujahid/metricEval-longSum。

关键词

引用

@article{arxiv.2511.07689,
  title  = {Stress Testing Factual Consistency Metrics for Long-Document Summarization},
  author = {Zain Muhammad Mujahid and Dustin Wright and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2511.07689},
  year   = {2026}
}

备注

Accepted in Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)