基于 Transformer 的多源域适应
机器学习
2020-09-17 v1 计算与语言
机器学习
摘要
在实际的机器学习场景中,模型必须在其上做预测的数据往往来自与训练数据不同的分布。在此,我们研究无监督多源域适应问题:模型在来自多个源域的带标签数据上训练,且必须对未见任何带标签数据的域做预测。此前基于 CNN 和 RNN 的工作已展示了专家混合的收益——即多个域专家分类器的预测被组合;以及域对抗训练,以诱导出域不可知的表示空间。受此启发,我们研究此类方法如何能有效应用于大型预训练 transformer 模型。我们发现,域对抗训练对这些模型所学表示有影响,但对其性能影响甚微,这表明大型基于 transformer 的模型已相对跨域鲁棒。此外,我们通过比较若干混合函数变体(包括一个基于注意力的新颖混合)表明,专家混合带来了显著的性能提升。最后,我们证明大型预训练基于 transformer 的域专家的预测高度同质,使得学习有效的函数以混合其预测颇具挑战。
引用
@article{arxiv.2009.07806,
title = {Transformer Based Multi-Source Domain Adaptation},
author = {Dustin Wright and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2009.07806},
year = {2020}
}
备注
12 pages, 3 figures, 5 tables