中文

ROUGE 2.0:用于摘要任务评估的更新与改进度量

信息检索 2018-03-07 v1 人工智能 计算与语言

摘要

摘要任务的评估对确定机器生成摘要的质量极为关键。在过去十年中,ROUGE 已成为评估摘要任务的标准自动评估度量。尽管 ROUGE 已被证明能有效捕捉系统与人工撰写摘要之间的 n-gram 重叠,现有 ROUGE 度量在捕捉同义概念与主题覆盖方面存在若干局限。因此,ROUGE 分数常不能反映摘要真实质量,并阻碍了对摘要的多角度评估(即按主题、按整体内容覆盖等)。本文引入 ROUGE 2.0,其包含若干更新的 ROUGE 度量:ROUGE-N+Synonyms、ROUGE-Topic、ROUGE-Topic+Synonyms、ROUGE-TopicUniq 和 ROUGE-TopicUniq+Synonyms;所有这些均为对核心 ROUGE 度量的改进。

关键词

引用

@article{arxiv.1803.01937,
  title  = {ROUGE 2.0: Updated and Improved Measures for Evaluation of Summarization Tasks},
  author = {Kavita Ganesan},
  journal= {arXiv preprint arXiv:1803.01937},
  year   = {2018}
}