MTG:一个多语言文本生成基准套件
计算与语言
2022-06-13 v2
摘要
我们介绍 MTG,一个用于训练和评估多语言文本生成的新基准套件。它是首个提出的多语言多向文本生成数据集,具有最大规模的人工标注数据(400k)。它涵盖五种语言(英语、德语、法语、西班牙语和中文)上的四项生成任务(故事生成、问题生成、标题生成和文本摘要)。多向设置使得能够测试模型跨语言与任务的知识迁移能力。利用 MTG,我们从不同方面训练并分析了几种流行的多语言生成模型。我们的基准套件借助更多人工标注平行数据促进模型性能提升,并提供具有多样生成场景的综合评估。代码与数据见 \url{https://github.com/zide05/MTG}。
引用
@article{arxiv.2108.07140,
title = {MTG: A Benchmark Suite for Multilingual Text Generation},
author = {Yiran Chen and Zhenqiao Song and Xianze Wu and Danqing Wang and Jingjing Xu and Jiaze Chen and Hao Zhou and Lei Li},
journal= {arXiv preprint arXiv:2108.07140},
year = {2022}
}
备注
NAACL2022 findings