中文

面向多域自监督学习的域不变掩码自编码器

计算机视觉与模式识别 2022-06-07 v2

摘要

将习得表征泛化到显著不同的视觉域是人类视觉系统的一项基本且关键的能力。尽管近期自监督学习方法在评估集与训练集同域时取得了良好性能,但在不同域上测试时会出现不理想的性能下降。因此,多域自监督学习任务被提出,以学习不仅适用于同域评估、也能泛化至未见域的域不变特征。本文提出一种用于多域自监督学习的域不变掩码自编码器(DiMAE),其设计了一种新 pretext 任务,即跨域重建任务,以学习域不变特征。核心思想是用来自不同域的风格噪声增强输入图像,再从增强图像的嵌入中重建图像,从而正则化编码器学习域不变特征。为实现该思路,DiMAE 包含两项关键设计:1)保内容风格混合,以无参数方式在保留输入内容的同时添加其他域的风格信息;2)多个域特定解码器,将输入对应域风格恢复到编码的域不变特征以进行重建。在 PACS 和 DomainNet 上的实验表明,与近期最先进方法相比,DiMAE 取得了可观增益。

关键词

引用

@article{arxiv.2205.04771,
  title  = {Domain Invariant Masked Autoencoders for Self-supervised Learning from Multi-domains},
  author = {Haiyang Yang and Meilin Chen and Yizhou Wang and Shixiang Tang and Feng Zhu and Lei Bai and Rui Zhao and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2205.04771},
  year   = {2022}
}