中文

基于事实 grounding 重访数据到文本生成中的挑战

计算与语言 2020-01-14 v1

摘要

数据到文本生成模型在通过引用正确输入源以确保数据保真度方面面临挑战。为启发该领域研究,Wiseman等人(2017)引入了RotoWire语料库,用于从盒分与线分表生成NBA比赛摘要。然而,此方向上尝试有限且挑战犹存。我们观察到该语料库中的一个显著瓶颈:仅约60%的摘要内容可grounding至盒分记录。此类信息缺失易误导条件语言模型产生无条件的随机事实,从而导致事实幻觉。本工作中,我们恢复信息平衡并改进该任务,聚焦于基于事实grounding的数据到文本生成。我们引入了净化且更大规模的数据集RotoWire-FG(Fact-Grounding),含2017–19年多50%的数据并丰富了输入表,希望吸引更多研究聚焦此方向。此外,我们通过集成一种新形式的表重建作为辅助任务以提升生成质量,实现了相较SOTA模型更优的数据保真度。

关键词

引用

@article{arxiv.2001.03830,
  title  = {Revisiting Challenges in Data-to-Text Generation with Fact Grounding},
  author = {Hongmin Wang},
  journal= {arXiv preprint arXiv:2001.03830},
  year   = {2020}
}

备注

Best Paper Runner-up at INLG 2019 (12th International Conference on Natural Language Generation)