Wikidata 多语言语义解析中的组合泛化
计算与语言
2022-06-01 v2
摘要
语义解析(SP)使人们能够通过自然交互利用海量知识资源。然而,解析器大多针对英语资源设计并在其上评估,例如 CFQ(Keysers 等人,2020),这是基于从语法规则生成的英语数据、面向已过时知识库 Freebase 的当前标准基准。我们提出了一种创建基于 Wikidata 的多语言并行问答对数据集的方法。我们引入了这样一个数据集,称之为多语言组合 Wikidata 问答集(MCWQ),并用它分析希伯来语、卡纳达语、汉语和英语中语义解析器的组合泛化。虽然语言内泛化在各语言间相当,但零样本跨语言迁移实验表明,即便使用最先进的预训练多语言编码器,跨语言组合泛化也会失败。此外,我们的方法、数据集和结果将促进在未来比现有资源更真实且多样的设置下开展 SP 研究。
引用
@article{arxiv.2108.03509,
title = {Compositional Generalization in Multilingual Semantic Parsing over Wikidata},
author = {Ruixiang Cui and Rahul Aralikatte and Heather Lent and Daniel Hershcovich},
journal= {arXiv preprint arXiv:2108.03509},
year = {2022}
}
备注
Accepted to TACL; Authors' final version, pre-MIT Press publication; Previous title: Multilingual Compositional Wikidata Questions