中文

用于分析长度受限标题生成模型评估的大规模多长度标题语料库

计算与语言 2019-09-27 v4

摘要

如今在多种设备上浏览新闻文章已成为可能。新闻文章标题的长度有精确的上限,由相关设备或界面的显示尺寸决定。因此,在将标题生成任务应用于新闻生产时,控制标题长度至关重要。然而,由于针对给定文章不存在多长度标题语料库,先前关于标题生成中输出长度控制的研究并未讨论:若无不同长度的多个参考,系统输出能否得到充分评估。在本文中,我们引入了两个语料库,即日本新闻语料库(JNC)和日文多长度标题语料库(JAMUL),以确认先前评估设置的合理性。JNC 为标题生成提供通用的监督数据。JAMUL 是由专业编辑撰写的三种不同长度标题的大规模评估数据集。我们报告了关于这些语料库的新发现;例如,尽管最长长度的参考摘要能恰当评估现有的长度控制输出方法,但该评估设置存在若干问题。

关键词

引用

@article{arxiv.1903.11771,
  title  = {A Large-Scale Multi-Length Headline Corpus for Analyzing Length-Constrained Headline Generation Model Evaluation},
  author = {Yuta Hitomi and Yuya Taguchi and Hideaki Tamori and Ko Kikuta and Jiro Nishitoba and Naoaki Okazaki and Kentaro Inui and Manabu Okumura},
  journal= {arXiv preprint arXiv:1903.11771},
  year   = {2019}
}

备注

Accepted by INLG 2019