中文

基于信息瓶颈原则的掩码重构对比学习

计算机视觉与模式识别 2022-11-17 v1 信息论 math.IT

摘要

对比学习(CL)因能捕捉大规模数据间的内在关联,在无监督学习中展现出强大能力。当前的 CL 模型由于判别性任务设置,偏向于仅学习区分正负样本对的能力。然而,这种偏向会导致忽略其对其他下游任务的充分性,我们称之为判别信息过拟合问题。在本文中,我们提出从信息瓶颈(IB)原则的角度解决上述问题,进一步推进 CL 的前沿。具体而言,我们给出新视角:CL 是 IB 原则的实例化,包括信息压缩与表达。我们从理论上分析了最优信息情形,并证明最小充分增强与信息泛化表示是实现最大压缩与下游任务泛化能力的最优要求。因此,我们提出掩码重构对比学习(MRCL)模型以改进 CL 模型。为实际实现,MRCL 利用掩码操作进行更强增强,进一步消除冗余与噪声信息。为有效缓解判别信息过拟合问题,我们采用重构任务来正则化判别任务。我们进行了综合实验,并在包括图像分类、语义分割与目标检测在内的多个任务上展示了所提模型的优越性。

关键词

引用

@article{arxiv.2211.09013,
  title  = {Masked Reconstruction Contrastive Learning with Information Bottleneck Principle},
  author = {Ziwen Liu and Bonan Li and Congying Han and Tiande Guo and Xuecheng Nie},
  journal= {arXiv preprint arXiv:2211.09013},
  year   = {2022}
}