多模态抽取式摘要中事实性的评估与改进
计算与语言
2022-11-07 v1 人工智能
计算机视觉与模式识别
摘要
当前用于评估抽取式文档摘要事实性的指标已与人类判断达到高相关性,但它们未考虑视觉模态,因此不足以用于视觉-语言摘要。我们提出CLIPBERTScore,一种CLIPScore与BERTScore的简单加权组合,分别利用图像-摘要与文档-摘要之间鲁棒且强的事实性检测性能。接下来,由于缺乏用于评估多模态事实性指标质量的元评估基准,我们收集了关于文档与图像事实性的人类判断。我们表明,这种在零样本设置下两个指标的组合比现有的文档摘要事实性指标达到更高的相关性,优于现有的多模态摘要指标,并与专门为该任务微调的强多模态事实性指标具有竞争力。我们的深入分析展示了CLIPBERTScore及其组件在四个事实性指标评估基准上的鲁棒性与高相关性。最后,我们展示了CLIPBERTScore指标的两个实用下游应用:用于在训练中选择需关注的重要图像,以及作为强化学习的奖励以改进多模态摘要生成的事实性(依据自动与人工评估)。我们的数据与代码公开于 https://github.com/meetdavidwan/faithful-multimodal-summ。
引用
@article{arxiv.2211.02580,
title = {Evaluating and Improving Factuality in Multimodal Abstractive Summarization},
author = {David Wan and Mohit Bansal},
journal= {arXiv preprint arXiv:2211.02580},
year = {2022}
}
备注
EMNLP 2022 (17 pages)