中文

重审科学文章摘要评估

计算与语言 2016-04-05 v1

摘要

文本摘要方法的评估主要基于衡量系统生成摘要与一组人工撰写的金标准摘要之间相似度的指标。摘要评估中最广泛使用的指标是 ROUGE 系列。ROUGE 仅依赖于句子中术语和短语的词汇重叠;因此,在术语变化和改写的情况下,ROUGE 的效果不佳。科学文章摘要便是不同于通用领域摘要(例如新闻数据)的一种情况。我们对 ROUGE 作为科学摘要评估指标的有效性进行了广泛分析;结果表明,与普遍看法相反,ROUGE 在评估科学摘要时并不可靠。此外,我们展示了 ROUGE 的不同变体如何导致与人工 Pyramid 分数的相关性存在显著差异。最后,我们提出了一种基于系统生成摘要与相应人工撰写摘要之间内容相关性的替代摘要评估指标。我们将该指标称为 SERA(Summarization Evaluation by Relevance Analysis,基于相关性分析的摘要评估)。与 ROUGE 不同,SERA 始终与人工分数保持高度相关,这表明其在科学文章摘要评估中的有效性。

关键词

引用

@article{arxiv.1604.00400,
  title  = {Revisiting Summarization Evaluation for Scientific Articles},
  author = {Arman Cohan and Nazli Goharian},
  journal= {arXiv preprint arXiv:1604.00400},
  year   = {2016}
}

备注

LREC 2016