为新闻报道生成代表性标题
计算与语言
2020-04-15 v4 人工智能
信息检索
摘要
每天有数百万篇新闻文章在线发布,读者难以全部跟进。将报道同一事件的多篇文章聚为新闻报道,是协助读者消费新闻的常用方式。然而,如何高效且有效地为每篇报道生成代表性标题仍是一个具有挑战性的研究问题。文档集的自动摘要研究已持续数十年,但聚焦于为一组文章生成代表性标题的研究甚少。与旨在以最少冗余捕获最多信息的摘要不同,标题旨在以简短篇幅捕获报道文章共同共享的信息,并排除过于具体到各单篇文章的信息。本工作中,我们研究为新闻报道生成代表性标题的问题。我们开发了一种远程监督方法来训练大规模生成模型,无需任何人工标注。该方法围绕两个技术组件展开。首先,我们提出一个多级预训练框架,在不同层级以不同的质量-数量平衡融入海量无标注语料。我们表明,在该框架内训练的模型优于仅用人工整理语料训练的模型。其次,我们提出一种新颖的基于自投票的文章注意力层,以提取多篇文章共享的显著信息。我们表明,融入该层的模型对新闻报道中的潜在噪声具有鲁棒性,并在有或无噪声情况下均优于现有基线。我们还可通过融入人工标签进一步增强模型,并表明我们的远程监督方法显著减少了对标注数据的需求。
引用
@article{arxiv.2001.09386,
title = {Generating Representative Headlines for News Stories},
author = {Xiaotao Gu and Yuning Mao and Jiawei Han and Jialu Liu and Hongkun Yu and You Wu and Cong Yu and Daniel Finnie and Jiaqi Zhai and Nicholas Zukoski},
journal= {arXiv preprint arXiv:2001.09386},
year = {2020}
}
备注
WebConf 2020 (WWW 2020)