ToTTo:一个受控的表到文本生成数据集
计算与语言
2020-10-07 v3 机器学习
摘要
我们提出ToTTo,一个拥有超过120,000个训练样本的开放领域英文表到文本数据集,其提出了一项受控生成任务:给定一张维基百科表格和一组高亮表格单元,生成一句描述。为获得自然且忠实于源表格的生成目标,我们引入了由标注者直接修订维基百科中现有候选句子的数据集构建流程。我们对该数据集及标注流程进行了系统分析,并给出了若干SOTA(state-of-the-art,最优)基线所取得的结果。现有方法虽然通常流畅,却常产生表格不支持的幻觉短语,这表明该数据集可作为高精度条件文本生成的有用研究基准。
引用
@article{arxiv.2004.14373,
title = {ToTTo: A Controlled Table-To-Text Generation Dataset},
author = {Ankur P. Parikh and Xuezhi Wang and Sebastian Gehrmann and Manaal Faruqui and Bhuwan Dhingra and Diyi Yang and Dipanjan Das},
journal= {arXiv preprint arXiv:2004.14373},
year = {2020}
}
备注
Accepted to EMNLP 2020