提升标题生成的真实性
计算与语言
2020-05-06 v2
摘要
大多数关于抽取式摘要的研究报告系统与参考摘要之间的 ROUGE 分数。然而,我们关注生成摘要的真实性:即生成摘要的所有事实是否都在源文本中提及。本文在两个流行数据集上探索改进标题生成的真实性。分析由最先进的编码器-解码器模型生成的标题,我们表明该模型有时会生成不真实的标题。我们推测原因之一在于用于训练模型的监督数据不真实。为了量化文章-标题对的真实性,我们考虑文章是否蕴含其标题的文本蕴含关系。在确认数据集中有相当多不真实实例后,本研究假设从监督数据中移除不真实实例可缓解模型不真实行为的问题。构建一个预测文章与其标题之间蕴含关系的二分类器,我们从监督数据中过滤掉不真实实例。实验结果表明,在过滤后的监督数据上训练的标题生成模型在 ROUGE 分数上无明显差异,但在生成标题的自动与人工评估上有显著改进。
引用
@article{arxiv.2005.00882,
title = {Improving Truthfulness of Headline Generation},
author = {Kazuki Matsumaru and Sho Takase and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2005.00882},
year = {2020}
}
备注
Accepted to ACL 2020