ZGUL:利用语言适配器多源集成实现向未见语言的零样本泛化
计算与语言
2023-10-26 v1
摘要
我们通过使用语言适配器(Language Adapters, LAs)解决NLP任务中的零样本跨语言迁移问题。多数早期工作探索了使用单一来源(通常为英语)适配器进行训练,并或使用目标LA或另一相关语言的LA进行测试。训练目标LA需要无标注数据,而对于低资源未见语言——即底层多语言语言模型(如mBERT)未见过的、且我们没有任何(有标注或无标注)数据的语言——这类数据可能不易获取。我们假定,为更有效地跨语言迁移,除单一来源LA外,我们需要在训练与测试时均利用多个(语言或地理相关)源语言LA——这通过我们新颖的神经架构ZGUL进行了探究。在四个语族、覆盖15种未见目标语言上的大量实验表明,在词性标注与命名实体识别(NER)任务上,相较标准微调及其他强基线,平均F1分数提升高达3.2点。我们还将ZGUL扩展至以下设定:目标语言有(1)部分无标注数据或(2)少量训练样本可用。我们发现ZGUL在这些设定下同样持续优于基线。
引用
@article{arxiv.2310.16393,
title = {ZGUL: Zero-shot Generalization to Unseen Languages using Multi-source Ensembling of Language Adapters},
author = {Vipul Rathore and Rajdeep Dhingra and Parag Singla and Mausam},
journal= {arXiv preprint arXiv:2310.16393},
year = {2023}
}