UXLA:一种面向零资源跨语言 NLP 的鲁棒无监督数据增强框架
计算与语言
2021-06-29 v4 机器学习
摘要
迁移学习已在许多有监督 NLP 任务中取得最先进(SoTA)结果。然而,每种目标语言中每个目标任务的标注数据都十分稀缺,尤其对于低资源语言。我们提出 UXLA,一种面向零资源迁移学习场景的新型无监督数据增强框架。具体而言,UXLA 旨在解决从源语言任务分布到未知目标语言任务分布的跨语言适配问题,并假设目标语言中无训练标签。其核心是,UXLA 执行同步自训练与数据增强及无监督样本选择。为展示其有效性,我们在三个多样的零资源跨语言迁移任务上进行了大量实验。UXLA 在所有任务中均取得 SoTA 结果,以明显优势超越基线。通过深入的框架剖析,我们展示了不同组件对其成功的累积贡献。
引用
@article{arxiv.2004.13240,
title = {UXLA: A Robust Unsupervised Data Augmentation Framework for Zero-Resource Cross-Lingual NLP},
author = {M Saiful Bari and Tasnim Mohiuddin and Shafiq Joty},
journal= {arXiv preprint arXiv:2004.13240},
year = {2021}
}
备注
ACL-2021 accepted paper