自增强改进零样本跨语言迁移
计算与语言
2023-09-21 v1 人工智能
机器学习
摘要
零样本跨语言迁移是多语言 NLP 的核心任务,它使在训练资源更充足的语言上训练的模型能够泛化到其他低资源语言。该任务的早期工作使用平行语料库、双语词典或其他标注对齐数据来改进跨语言可迁移性,而这些数据通常获取成本高昂。在本文中,我们提出了一种简单而有效的方法 SALT,在无需此类外部数据帮助的情况下改进多语言预训练语言模型的零样本跨语言迁移。通过结合 code-switching 和 embedding mixup 与自增强,SALT 有效地从多语言 PLM 中蒸馏跨语言知识,并增强其在下游任务上的可迁移性。在 XNLI 和 PAWS-X 上的实验结果表明,我们的方法能够在不使用外部数据的情况下改进零样本跨语言可迁移性。我们的代码可在 https://github.com/luka-group/SALT 获取。
引用
@article{arxiv.2309.10891,
title = {Self-Augmentation Improves Zero-Shot Cross-Lingual Transfer},
author = {Fei Wang and Kuan-Hao Huang and Kai-Wei Chang and Muhao Chen},
journal= {arXiv preprint arXiv:2309.10891},
year = {2023}
}
备注
AACL 2023