中文

迈向以问答作为评估摘要内容质量的自动指标

计算与语言 2021-07-28 v3

摘要

衡量摘要内容质量的基于参考的评估指标的一个理想特性是,它应估计该摘要与参考共有的信息量。传统的基于文本重叠的指标(如ROUGE)无法实现这一点,因为它们局限于匹配词元,无论是词汇上还是通过嵌入。在这项工作中,我们提出一种利用问答(QA)评估摘要内容质量的指标。基于QA的方法直接度量摘要与参考的信息重叠,使其在根本上不同于文本重叠指标。我们通过对所提指标QAEval的分析展示了基于QA指标的实验优势。QAEval在使用基准数据集的大多数评估中优于当前最先进(state-of-the-art)指标,而在其他评估中因最先进模型的局限性而具竞争力。通过对QAEval各组成部分的细致分析,我们确定了其性能瓶颈,并估计其潜在上限性能超越所有其他自动指标,接近黄金标准金字塔法(Pyramid Method)。

关键词

引用

@article{arxiv.2010.00490,
  title  = {Towards Question-Answering as an Automatic Metric for Evaluating the Content Quality of a Summary},
  author = {Daniel Deutsch and Tania Bedrax-Weiss and Dan Roth},
  journal= {arXiv preprint arXiv:2010.00490},
  year   = {2021}
}

备注

This is a pre-MIT Press publication version of the paper