自监督表征学习作为相互信息最大化
机器学习
2025-10-03 v1
摘要
自监督表征学习 (SSRL) 已展现出显著的经验成功,但其 underlying 原理仍不够人类了解。虽然近期工作尝试通过检视其信息论目标或概括其防止表征坍缩的启发式方法来统一 SSRL 方法,但诸如预测网络、停止梯度操作及统计正则化器等结构性元素常被视为以经验方式添加的附加项。本文我们采用首原则方法,探讨 SSRL 算法的学习目标是否决定其可能的优化策略和模型设计选择。具体而言,通过从变分相互信息 (MI) 下界出发,我们推导两种训练范式,即 Self-Distillation MI (SDMI) 和 Joint MI (JMI),每种均施加 distinct 结构约束并涵盖一系列现有 SSRL 方法。SDMI 本质上需要交替优化,使停止梯度操作在理论上至关重要。相比之下,JMI 通过对称架构允许联合优化,无需此类组件。在所提出的公式下,SDMI 中的预测网络以及 JMI 中的统计正则化器均可作为 MI 目标的可行替代方案。我们表明许多现有 SSRL 方法是上述两种范式的具体实例或近似。本文提供了对现有 SSRL 方法不同结构性组件选择的理论解释,超越启发式便利之利。
引用
@article{arxiv.2510.01345,
title = {Self-Supervised Representation Learning as Mutual Information Maximization},
author = {Akhlaqur Rahman Sabby and Yi Sui and Tongzi Wu and Jesse C. Cresswell and Ga Wu},
journal= {arXiv preprint arXiv:2510.01345},
year = {2025}
}