中文

MTG:一个多语言文本生成基准套件

计算与语言 2022-06-13 v2

摘要

我们介绍 MTG,一个用于训练和评估多语言文本生成的新基准套件。它是首个提出的多语言多向文本生成数据集,具有最大规模的人工标注数据(400k)。它涵盖五种语言(英语、德语、法语、西班牙语和中文)上的四项生成任务(故事生成、问题生成、标题生成和文本摘要)。多向设置使得能够测试模型跨语言与任务的知识迁移能力。利用 MTG,我们从不同方面训练并分析了几种流行的多语言生成模型。我们的基准套件借助更多人工标注平行数据促进模型性能提升,并提供具有多样生成场景的综合评估。代码与数据见 \url{https://github.com/zide05/MTG}。

关键词

引用

@article{arxiv.2108.07140,
  title  = {MTG: A Benchmark Suite for Multilingual Text Generation},
  author = {Yiran Chen and Zhenqiao Song and Xianze Wu and Danqing Wang and Jingjing Xu and Jiaze Chen and Hao Zhou and Lei Li},
  journal= {arXiv preprint arXiv:2108.07140},
  year   = {2022}
}

备注

NAACL2022 findings