利用自动化无监督离群值仲裁改进自监督学习
机器学习
2021-12-16 v1 人工智能
计算机视觉与模式识别
摘要
我们的工作揭示了现有主流自监督学习方法的一个结构性缺陷。尽管自监督学习框架通常想当然地采用流行的完美实例级不变性假设,我们仔细研究了其背后的隐患。特别地,我们指出,用于生成多个正视图的现有增广流程自然引入了分布外(OOD)样本,损害了下游任务的学习。对输入生成多样的正增广并不总能在有益于下游任务上带来回报。为克服这一固有缺陷,我们引入了一个轻量级潜变量模型 UOTA,针对自监督学习的视图采样问题。UOTA 自适应地搜索最重要的采样区域以生成视图,并为鲁棒于离群值的自监督学习方法提供了可行选择。我们的方法直接推广到许多主流自监督学习方法,无论其损失本质上是否对比。我们通过实验以明显优势展示了 UOTA 相对于最先进自监督范式的优越性,这很好地证明了现有方法中嵌入的 OOD 样本问题的存在。特别地,我们从理论上证明了该方法的优点可归结为有保证的估计器方差与偏差的降低。代码见:https://github.com/ssl-codelab/uota。
引用
@article{arxiv.2112.08132,
title = {Improving Self-supervised Learning with Automated Unsupervised Outlier Arbitration},
author = {Yu Wang and Jingyang Lin and Jingjing Zou and Yingwei Pan and Ting Yao and Tao Mei},
journal= {arXiv preprint arXiv:2112.08132},
year = {2021}
}
备注
NeurIPS 2021; Code is publicly available at: https://github.com/ssl-codelab/uota