WikiTableT:用于生成维基百科条目章节的大规模数据到文本数据集
计算与语言
2021-06-03 v2
摘要
数据到文本生成的数据集通常要么关注多领域单句生成,要么关注单领域长文生成。在这项工作中,我们将生成维基百科章节视为数据到文本生成任务,并创建了一个大规模数据集 WikiTableT,将维基百科章节与其对应的表格数据及各种元数据配对。WikiTableT 包含数百万实例,涵盖广泛主题,以及具有不同灵活性的多种生成任务类型。我们在 WikiTableT 上对若干训练与解码策略进行了基准测试。我们的定性分析表明,最佳方法能生成流畅且高质量的文本,但在连贯性与事实性方面存在困难,这显示了我们的数据集推动未来长文生成工作的潜力。
引用
@article{arxiv.2012.14919,
title = {WikiTableT: A Large-Scale Data-to-Text Dataset for Generating Wikipedia Article Sections},
author = {Mingda Chen and Sam Wiseman and Kevin Gimpel},
journal= {arXiv preprint arXiv:2012.14919},
year = {2021}
}
备注
Findings of ACL 2021, camera-ready version