中文

稀疏混合专家是具有域泛化能力的 learner

计算机视觉与模式识别 2023-01-30 v6 人工智能 机器学习

摘要

人类视觉感知可轻松泛化到分布外视觉数据,这远超出现代机器学习模型的能力。域泛化(DG)旨在缩小这一差距,现有DG方法主要关注损失函数设计。本文提出探索一个正交方向,即骨干网络架构的设计。其动机来自一个经验发现:在多个DG数据集上,采用经验风险最小化(ERM)训练的基于transformer的模型优于使用最先进(SOTA)DG算法的基于CNN的模型。我们建立了一个形式化框架,通过研究网络架构与数据集中相关性的对齐程度来刻画网络对分布偏移的鲁棒性。该分析引导我们提出一种基于视觉transformer构建的新颖DG模型,即可泛化混合专家(GMoE)。在DomainBed上的大量实验表明,采用ERM训练的GMoE大幅优于SOTA DG基线。此外,GMoE与现有DG方法互补,当使用DG算法训练时其性能得到显著提升。

关键词

引用

@article{arxiv.2206.04046,
  title  = {Sparse Mixture-of-Experts are Domain Generalizable Learners},
  author = {Bo Li and Yifei Shen and Jingkang Yang and Yezhen Wang and Jiawei Ren and Tong Che and Jun Zhang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2206.04046},
  year   = {2023}
}

备注

ICLR 2023 (accepted as Oral presentation)