中文

面向自监督图像表征学习的信息最大化软变量离散化

计算机视觉与模式识别 2025-01-08 v1

摘要

自监督学习(SSL)已成为图像处理、编码和理解领域的关键技术,尤其对于利用大规模无标注数据以提升各种下游任务的当今视觉基础模型至关重要。本研究提出一种新颖的 SSL 方法,信息最大化软变量离散化(IMSVD),用于图像表征学习。具体而言,IMSVD 对潜在空间中的每个变量进行软离散化,使其能够在训练批次上估计其概率分布,并允许学习过程直接受信息度量指导。受多视角假设启发,我们提出了信息论目标函数,以学习变换不变、非毁坏且冗余最小化的表征特征。我们随后推导了用于自监督图像表征学习的联合交叉熵损失函数,该方法在减少特征冗余方面理论上具有优势。值得注意的是,我们的非对比 IMSVD 方法在统计上表现出对比学习。广泛的实验结果表明,IMSVD 在各种下游任务上在准确率和效率方面均表现出色。由于我们的变量离散化,IMSVD 优化的嵌入特征在变量层面提供了独特的可解释性。IMSVD 有望适用于其他学习范式。我们的代码已公开于 https://github.com/niuchuangnn/IMSVD。

关键词

引用

@article{arxiv.2501.03469,
  title  = {Information-Maximized Soft Variable Discretization for Self-Supervised Image Representation Learning},
  author = {Chuang Niu and Wenjun Xia and Hongming Shan and Ge Wang},
  journal= {arXiv preprint arXiv:2501.03469},
  year   = {2025}
}