中文

Wikidata 多语言语义解析中的组合泛化

计算与语言 2022-06-01 v2

摘要

语义解析(SP)使人们能够通过自然交互利用海量知识资源。然而,解析器大多针对英语资源设计并在其上评估,例如 CFQ(Keysers 等人,2020),这是基于从语法规则生成的英语数据、面向已过时知识库 Freebase 的当前标准基准。我们提出了一种创建基于 Wikidata 的多语言并行问答对数据集的方法。我们引入了这样一个数据集,称之为多语言组合 Wikidata 问答集(MCWQ),并用它分析希伯来语、卡纳达语、汉语和英语中语义解析器的组合泛化。虽然语言内泛化在各语言间相当,但零样本跨语言迁移实验表明,即便使用最先进的预训练多语言编码器,跨语言组合泛化也会失败。此外,我们的方法、数据集和结果将促进在未来比现有资源更真实且多样的设置下开展 SP 研究。

关键词

引用

@article{arxiv.2108.03509,
  title  = {Compositional Generalization in Multilingual Semantic Parsing over Wikidata},
  author = {Ruixiang Cui and Rahul Aralikatte and Heather Lent and Daniel Hershcovich},
  journal= {arXiv preprint arXiv:2108.03509},
  year   = {2022}
}

备注

Accepted to TACL; Authors' final version, pre-MIT Press publication; Previous title: Multilingual Compositional Wikidata Questions