中文

El Volumen Louder Por Favor:面向任务语义解析中的语码转换

计算与语言 2021-01-29 v3 人工智能 机器学习

摘要

能够解析语码转换(CS)话语,例如西班牙语+英语或印地语+英语,对于使面向任务的语义解析系统在某些语言区域中普及至关重要。在本工作中,我们聚焦于 Spanglish(西班牙语+英语)并发布一个名为 CSTOP 的数据集,包含 5800 条 CS 话语及其语义解析。我们考察了多种跨语言(XL)模型在 CS 上的泛化能力,并展示了当仅存在一种语言的数据时预训练 XL 语言模型的优势。据此,我们致力于改进预训练模型在仅含英语语料且附带零条或极少 CS 训练实例时的情形。我们针对零样本与少样本设定提出两种数据增强方法:使用翻译对齐进行微调,以及使用生成模型随后匹配过滤进行增强。将少样本设定与上述改进相结合,可将零样本与全数据设定之间初始 30 个百分点的准确率差距缩小三分之二。

关键词

引用

@article{arxiv.2101.10524,
  title  = {El Volumen Louder Por Favor: Code-switching in Task-oriented Semantic Parsing},
  author = {Arash Einolghozati and Abhinav Arora and Lorena Sainz-Maza Lecanda and Anuj Kumar and Sonal Gupta},
  journal= {arXiv preprint arXiv:2101.10524},
  year   = {2021}
}