中文

MASSIVE:一个含51种类型学多样语言的百万级示例多语言自然语言理解数据集

计算与语言 2022-06-20 v2 人工智能 机器学习

摘要

我们提出MASSIVE数据集——用于槽填充、意图分类和虚拟助手评估的多语言Amazon SLU资源包(SLURP)。MASSIVE包含100万条真实的、平行的、带标签的虚拟助手话语,涵盖51种语言、18个领域、60种意图和55个槽位。MASSIVE通过委托专业译员将仅含英语的SLURP数据集本地化为来自29个语系的50种类型学多样语言而创建。我们还给出了基于XLM-R和mT5的建模结果,包括精确匹配准确率、意图分类准确率和槽填充F1分数。我们已公开发布数据集、建模代码和模型。

关键词

引用

@article{arxiv.2204.08582,
  title  = {MASSIVE: A 1M-Example Multilingual Natural Language Understanding Dataset with 51 Typologically-Diverse Languages},
  author = {Jack FitzGerald and Christopher Hench and Charith Peris and Scott Mackie and Kay Rottmann and Ana Sanchez and Aaron Nash and Liam Urbach and Vishesh Kakarala and Richa Singh and Swetha Ranganath and Laurie Crist and Misha Britan and Wouter Leeuwis and Gokhan Tur and Prem Natarajan},
  journal= {arXiv preprint arXiv:2204.08582},
  year   = {2022}
}

备注

Preprint; 8 pages