中文

WikiTableT:用于生成维基百科条目章节的大规模数据到文本数据集

计算与语言 2021-06-03 v2

摘要

数据到文本生成的数据集通常要么关注多领域单句生成,要么关注单领域长文生成。在这项工作中,我们将生成维基百科章节视为数据到文本生成任务,并创建了一个大规模数据集 WikiTableT,将维基百科章节与其对应的表格数据及各种元数据配对。WikiTableT 包含数百万实例,涵盖广泛主题,以及具有不同灵活性的多种生成任务类型。我们在 WikiTableT 上对若干训练与解码策略进行了基准测试。我们的定性分析表明,最佳方法能生成流畅且高质量的文本,但在连贯性与事实性方面存在困难,这显示了我们的数据集推动未来长文生成工作的潜力。

关键词

引用

@article{arxiv.2012.14919,
  title  = {WikiTableT: A Large-Scale Data-to-Text Dataset for Generating Wikipedia Article Sections},
  author = {Mingda Chen and Sam Wiseman and Kevin Gimpel},
  journal= {arXiv preprint arXiv:2012.14919},
  year   = {2021}
}

备注

Findings of ACL 2021, camera-ready version