中文

Translate & Fill: 利用合成数据改进零样本多语言语义解析

计算与语言 2021-09-10 v1 人工智能 机器学习

摘要

尽管在单一语言上微调的多语言预训练语言模型(LM)已展现出显著的跨语言任务迁移能力,但当有目标语言监督可用时,语义解析任务中仍存在较大的性能差距。在本文中,我们提出了一种新颖的 Translate-and-Fill (TaF) 方法,为多语言语义解析器生成银标准训练数据。该方法简化了流行的 Translate-Align-Project (TAP) 流水线,由一个序列到序列的填充模型组成,该模型以话语和同一解析的视图为条件构建完整的解析。我们的填充模型仅在英语数据上训练,但能够以零样本方式准确补全其他语言(即英语训练话语的翻译)中的实例。在三个多语言语义解析数据集上的实验结果表明,使用 TaF 进行数据增强所达到的准确率,可与依赖传统对齐技术的类似系统相媲美。

关键词

引用

@article{arxiv.2109.04319,
  title  = {Translate & Fill: Improving Zero-Shot Multilingual Semantic Parsing with Synthetic Data},
  author = {Massimo Nicosia and Zhongdi Qu and Yasemin Altun},
  journal= {arXiv preprint arXiv:2109.04319},
  year   = {2021}
}

备注

Accepted to EMNLP 2021 (Findings)