中文

利用预训练模型且无微调的域泛化

计算机视觉与模式识别 2022-03-10 v1 人工智能

摘要

微调预训练模型是域泛化(DG)任务中的常见做法。然而,由于预训练模型规模不断增长,微调通常计算代价高昂。更重要的是,如近期工作所示,它可能导致对源域的过拟合并损害其泛化能力。一般而言,预训练模型具备一定程度的泛化能力,并能针对特定域和样本取得不错性能。然而,预训练模型在不同测试域甚至样本上的泛化性能可能差异显著,这给我们如何在DG任务中最好地利用预训练模型带来了挑战。本文提出一种更好地利用各类预训练模型的新型域泛化范式,称为面向域泛化的专用集成学习(SEDGE)。它首先在固定的预训练模型上训练一个线性标签空间适配器,将预训练模型的输出转换到目标域的标签空间。然后,提出一个感知模型专长的集成网络,动态分派合适的预训练模型来预测每个测试样本。在多个基准上的实验研究表明,与包括DG任务中state-of-the-art方法在内的强基线相比,SEDGE取得了显著性能提升,并将可训练参数减少约99%、训练时间减少约99.5%。

关键词

引用

@article{arxiv.2203.04600,
  title  = {Domain Generalization using Pretrained Models without Fine-tuning},
  author = {Ziyue Li and Kan Ren and Xinyang Jiang and Bo Li and Haipeng Zhang and Dongsheng Li},
  journal= {arXiv preprint arXiv:2203.04600},
  year   = {2022}
}