自动事实性指标是否衡量事实性?对自动事实性指标的批判性评估
计算与语言
2025-11-06 v4 人工智能
摘要
现代大语言模型(LLM)已能生成高度可读的抽象摘要,以至于传统用于评估摘要质量的自动指标(如 ROUGE)已饱和。然而,LLM 仍会在摘要中引入不一致于或不受源内容支持的信息。自动测量这些常微妙事实性不一致性一直具有挑战性。这又推动了开发旨在衡量生成摘要事实一致性的指标。但这些方法是否在衡量其所声称的事实性,或者仅通过利用副作用实现?本文对一系列自动事实性指标进行压力测试,探讨它们实际捕获的内容。通过使用浅层分类器将“容易”的事实评估案例(表面特征足以区分)与“困难”案例(需要深层推理)分开,我们发现所有指标在后者上表现显著下降。此外,一些指标对保留事实的 benign 修改比事实纠正更敏感。基于这一发现,我们展示大多数自动事实性指标可被游戏化,即通过在摘要末尾添加无害、内容自由的句子来人为提升分数。在测试的指标中,基于 ChatGPT-DA 方法的提示方法最为稳健可靠。然而,这也有一个显著的局限性:提示大语言模型评估事实性可能过度依赖其参数化知识,而非所提供的参考内容。综上所述,我们的发现质疑了当前事实性指标的可靠性,并促使对这些指标真正衡量的内容进行更广泛的反思。
引用
@article{arxiv.2411.16638,
title = {Do Automatic Factuality Metrics Measure Factuality? A Critical Evaluation},
author = {Sanjana Ramprasad and Byron C. Wallace},
journal= {arXiv preprint arXiv:2411.16638},
year = {2025}
}