XSemPLR:多种自然语言与意义表示下的跨语言语义解析
计算与语言
2023-06-08 v1
摘要
跨语言语义解析(CLSP)旨在将多种自然语言(NL)中的查询翻译为意义表示(MR),如 SQL、lambda 演算和逻辑形式。然而,现有 CLSP 模型分别在有限任务与应用的数据集上被提出和评估,阻碍了对 CLSP 在多样化 NL 与 MR 上的全面统一评估。为此,我们提出 XSemPLR,一个以 22 种自然语言和 8 种意义表示为特征的跨语言语义解析统一基准,通过考察并选取 9 个现有数据集以覆盖 5 项任务和 164 个领域。我们使用 XSemPLR 在广泛的多语言语言模型上开展综合基准研究,包括基于编码器的模型(mBERT、XLM-R)、编码器-解码器模型(mBART、mT5)和基于解码器的模型(Codex、BLOOM)。我们设计了 6 种实验设置,涵盖多种语言组合(单语、多语、跨语言)和学习样本数量(全数据集、少样本和零样本)。我们的实验表明,编码器-解码器模型(mT5)相较其他流行模型取得最高性能,且多语训练可进一步提升平均性能。值得注意的是,多语大语言模型(如 BLOOM)仍不足以执行 CLSP 任务。我们还发现,对于多语模型,单语训练与跨语言迁移学习间的性能差距仍显著,尽管可通过跨语言少样本训练缓解。我们的数据集与代码见 https://github.com/psunlpgroup/XSemPLR。
引用
@article{arxiv.2306.04085,
title = {XSemPLR: Cross-Lingual Semantic Parsing in Multiple Natural Languages and Meaning Representations},
author = {Yusen Zhang and Jun Wang and Zhiguo Wang and Rui Zhang},
journal= {arXiv preprint arXiv:2306.04085},
year = {2023}
}
备注
ACL 2023