利用对比信号引导扩散重建:实现视觉表征的平衡
计算机视觉与模式识别
2026-03-23 v2 人工智能
机器学习
摘要
对比式语言-图像预训练 (CLIP) 视觉编码器的理解能力已成为下游性能的关键瓶颈。该能力包括判别能力 (D-Ability),反映类别可分离性,以及细节感知能力 (P-Ability),聚焦于细粒度视觉线索。最近的解决方案使用扩散模型通过条件于 CLIP 视觉标记实现图像重建来增强表征。我们认为,这类范式可能损害 D-Ability,从而未能有效解决 CLIP 的表征限制。为此,我们将对比信号整合到基于扩散的重建中,以追求更全面的视觉表征。我们首先采用一种直观的设计,通过对输入图像进行对比学习来增强扩散过程。然而,实证结果表明,简单组合受到梯度冲突,导致次优性能。为平衡优化,我们引入扩散对比重建 (DCR),统一学习目标。关键思想是将来自每个重建图像的对比信号(而非来自原始输入)注入扩散过程。我们的理论分析表明,DCR 损失可以联合优化 D-Ability 和 P-Ability。广泛的实验在各种基准和多模态大语言模型上验证了该方法的有效性。代码可在 https://github.com/boyuh/DCR 获取。
引用
@article{arxiv.2603.04803,
title = {Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation},
author = {Boyu Han and Qianqian Xu and Shilong Bao and Zhiyong Yang and Ruochen Cui and Xilin Zhao and Qingming Huang},
journal= {arXiv preprint arXiv:2603.04803},
year = {2026}
}