多语言编码器对书面瑞士德语方言的模块化适配
计算与语言
2024-01-26 v1
摘要
由于训练数据匮乏以及方言差异,为书面瑞士德语创建神经文本编码器具有挑战性。在本文中,我们基于多个现有的多语言编码器,通过持续预训练将它们适配到瑞士德语。在三个不同的下游任务上的评估表明,简单地将一个瑞士德语适配器添加到一个模块化编码器中,就能达到完全单体适配性能的97.5%。我们进一步发现,对于给定标准德语查询检索瑞士德语句子的任务,适配字符级模型比其他适配策略更有效。我们在https://github.com/ZurichNLP/swiss-german-text-encoders发布我们的代码和为实验训练的模型。
引用
@article{arxiv.2401.14400,
title = {Modular Adaptation of Multilingual Encoders to Written Swiss German Dialect},
author = {Jannis Vamvas and Noëmi Aepli and Rico Sennrich},
journal= {arXiv preprint arXiv:2401.14400},
year = {2024}
}
备注
First Workshop on Modular and Open Multilingual NLP (MOOMIN 2024)