中文

对比MIM:统一生成式与判别式表征学习的对比相互信息框架

机器学习 2025-09-10 v2

摘要

学习能够对未知下游任务具有良好泛化性的表征是表征学习中的核心挑战。现有方法如对比学习、自监督掩码和去噪自编码器在不同权衡下解决了这一挑战。本文引入对比相互信息机器(contrastive MIM, cMIM),一种概率框架,通过引入新颖的对比目标扩展相互信息机器(MIM)。虽然MIM通过最大化输入与潜在变量之间的相互信息并鼓励潜在代码的聚类来学习表征,但其在判别式任务上的表现不及最先进的方法。cMIM通过保留MIM生成式优势的同时强制全局判别式结构,从而克服了这一限制。我们提出了两个主要贡献:(1) 提出cMIM,这是MIM的对比扩展版本,无需正数据增广且对批量大小鲁棒,不同于InfoNCE-based方法;(2) 引入信息丰富的嵌入(informative embeddings),这是一种从编码器-解码器模型中提取丰富表征的通用技术,显著提升判别式性能且无需额外训练,适用于范围广泛的场景。实验结果表明,cMIM在分类和回归任务中 consistently 优于MIM和InfoNCE,同时保持可比的重构质量。这些发现表明cMIM为同时高效地用于判别式和生成式应用提供了统一框架。

关键词

引用

@article{arxiv.2502.19642,
  title  = {Contrastive MIM: A Contrastive Mutual Information Framework for Unified Generative and Discriminative Representation Learning},
  author = {Micha Livne},
  journal= {arXiv preprint arXiv:2502.19642},
  year   = {2025}
}

备注

A working draft. Updated with image experiments and theoretical relation to InfoNCE