将解耦群表示作为特征的自监督学习
计算机视觉与模式识别
2021-11-01 v2 机器学习
摘要
良好的视觉表征是从观测(图像)到特征(向量)的推断映射,能忠实反映隐藏的模块化生成因子(语义)。本文从群论视角利用Higgins对解耦表征的定义形式化了“良好”表征的概念,并指出现有自监督学习(SSL)仅解耦了旋转、上色等简单增广特征,因而无法对剩余语义进行模块化。为突破该局限,我们提出一种迭代式SSL算法:基于划分的不变风险最小化迭代法(IP-IRM),其成功将抽象语义及作用于其上的群落地为具体的对比学习。在每次迭代中,IP-IRM首先将训练样本划分为对应于一个纠缠群元素的两个子集,然后最小化子集不变对比损失,其中不变性保证解耦该群元素。我们证明IP-IRM收敛于完全解耦表征,并其在多个基准上展示了有效性。代码见 https://github.com/Wangt-CN/IP-IRM。
引用
@article{arxiv.2110.15255,
title = {Self-Supervised Learning Disentangled Group Representation as Feature},
author = {Tan Wang and Zhongqi Yue and Jianqiang Huang and Qianru Sun and Hanwang Zhang},
journal= {arXiv preprint arXiv:2110.15255},
year = {2021}
}
备注
Accepted by NeurIPS 2021 (Spotlight)