TaTa:面向非洲语言的多语言表格到文本数据集
计算与语言
2022-11-02 v1 机器学习
摘要
现有的数据到文本生成数据集大多局限于英语。为弥补这一数据缺失,我们创建了非洲语言表格到文本数据集(TaTa),这是首个以非洲语言为重点的大型多语言表格到文本数据集。我们通过转录人口与健康调查项目双语报告中的图表及配套文本来创建 TaTa,随后进行专业翻译以使数据集完全平行。TaTa 包含九种语言中的 8,700 个样例,包括四种非洲语言(豪萨语、伊博语、斯瓦希里语和约鲁巴语)以及一种零样本测试语言(俄语)。我们还发布了原始图表的截图,以供未来关于多语言多模态方法的研究使用。通过深入的人工评估,我们表明 TaTa 对当前模型具有挑战性,且基于 mT5-XXL 的模型生成的输出中 understandable 且可归因于源数据的不足一半。我们进一步证明现有指标在 TaTa 上表现不佳,并引入了与人工判断高度相关的学习型指标。我们在 https://github.com/google-research/url-nlp 发布了所有数据与标注。
引用
@article{arxiv.2211.00142,
title = {TaTa: A Multilingual Table-to-Text Dataset for African Languages},
author = {Sebastian Gehrmann and Sebastian Ruder and Vitaly Nikolaev and Jan A. Botha and Michael Chavinda and Ankur Parikh and Clara Rivera},
journal= {arXiv preprint arXiv:2211.00142},
year = {2022}
}
备注
24 pages, 6 figures