一体同心与同心一体:以模型平均绕过超参数调优实现跨语言迁移
计算与语言
2023-10-17 v1
摘要
多语言语言模型实现了零样本跨语言迁移(ZS-XLT):在较大规模的源语言任务数据上微调后,它们无需标注样本即可在目标语言中执行任务。ZS-XLT 的有效性取决于语言间的语言学邻近度以及某语言的预训练数据量。因此,基于源语言验证的模型选择并不可靠:它挑选出的模型快照在目标语言上性能次优。作为补救,一些工作通过广泛调优超参数来优化 ZS-XLT:后续工作随后往往难以复现原始结果。其他工作在更窄的超参数网格上搜索,报告了明显更低的性能。在本工作中,我们因此提出一种用于 ZS-XLT 的无监督评估协议,将性能最大化与超参数调优解耦。作为广泛超参数调优的鲁棒且更透明的替代方案,我们提出将来自不同运行的快照累积平均为一个单一模型。我们在较高层语义任务(NLI、抽取式 QA)和较低层词元分类任务(NER)上进行了广泛的 ZS-XLT 实验,发现基于源语言验证的传统模型选择迅速停滞于次优的 ZS-XLT 性能。另一方面,我们对以不同超参数训练的模型进行逐次累积平均,提升了 ZS-XLT 性能,并与“预言式” ZS-XLT(即基于目标语言验证性能的模型选择)密切相关。
引用
@article{arxiv.2310.10532,
title = {One For All & All For One: Bypassing Hyperparameter Tuning with Model Averaging For Cross-Lingual Transfer},
author = {Fabian David Schmidt and Ivan Vulić and Goran Glavaš},
journal= {arXiv preprint arXiv:2310.10532},
year = {2023}
}
备注
Accepted to findings of EMNLP 2023