最大有用、最小冗余:不平衡数据的自监督学习关键
计算机视觉与模式识别
2026-04-03 v2
摘要
对比式自监督学习(CSSL)通常利用多视图假设,即所有相关信息必须在所有视图之间共享。CSSL 的主要目标是最大化不同视图表示之间的互信息(MI),同时压缩每个表示中的无关信息。最近,Schwartz Ziv & Yan LeCun 指出,当多视图假设被迫违反时,SSL 中最重要的挑战之一是识别新方法,以基于替代假设分离相关与无关信息。以此直觉为线索,我们在本文中作出以下贡献:1)我们开发了一个 CSSL 框架,其中将考虑多个图像和多个视图(MIMV)作为输入,这与传统的多视图假设不同;2)我们采用一种新颖的数据增强策略,包括规范化(可逆)和增强(不可逆)视图,以便保留一个图像的完整信息,同时可为另一个图像选择硬增强;3)为 MIMV 提出了信息瓶颈(IB)原则,以产生最佳表示;4)我们引入一个损失函数,有助于学习更好的表示,通过过滤掉极端特征;5)我们通过将其应用于不平衡数据集问题来建立我们提议框架的鲁棒性,其中我们在使用 Resnet-18 在 Cifar10-LT 上实现了 2% 的准确率提升,在使用 Resnet-18 在 Cifar100-LT 上实现了 5% 的准确率提升,在使用 Resnet-50 在 Imagenet-LT(1k)上实现了 3% 的准确率提升。
引用
@article{arxiv.2509.08469,
title = {Maximally Useful and Minimally Redundant: The Key to Self Supervised Learning for Imbalanced Data},
author = {Yash Kumar Sharma and Vineet Padmanabhan},
journal= {arXiv preprint arXiv:2509.08469},
year = {2026}
}