中文

GenHancer:不完美的生成模型实为强大的以视觉为中心的增强器

计算机视觉与模式识别 2025-08-01 v3

摘要

生成模型与判别模型之间的协同作用正受到越来越多的关注。尽管判别式对比语言-图像预训练(CLIP)擅长处理高层语义,但其在感知细粒度视觉细节方面存在困难。通常,为了增强表征,生成模型将 CLIP 的视觉特征作为重建的条件。然而,其内在原理仍有待深入探索。在本研究中,我们通过实验发现,视觉上完美的生成结果并不总是表征增强的最优选择。其本质在于从生成模型中有效提取细粒度知识,同时抑制无关信息。为了探索关键因素,我们深入研究了三个方面:(1)条件机制:我们发现,即使是少量的局部 token 也会大幅降低重建难度,导致训练坍塌。因此,我们得出结论,仅利用全局视觉 token 作为条件是最有效的策略。(2)去噪配置:我们观察到端到端训练会引入无关信息。为解决这一问题,我们提出了一种两阶段训练策略,以优先学习有用的视觉知识。此外,我们证明了轻量级去噪器也能带来显著提升。(3)生成范式:我们探索了连续和离散去噪器,均取得了理想结果,验证了我们方法的通用性。通过深入探索,我们最终提出了一种有效的方法,即 GenHancer,该方法在 MMVP-VLM 基准上始终优于先前方法,例如在 OpenAICLIP 上提升了 6.0%。增强后的 CLIP 可进一步插入多模态大语言模型中,以获得更好的以视觉为中心的性能。所有模型和代码均已公开。

关键词

引用

@article{arxiv.2503.19480,
  title  = {GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers},
  author = {Shijie Ma and Yuying Ge and Teng Wang and Yuxin Guo and Yixiao Ge and Ying Shan},
  journal= {arXiv preprint arXiv:2503.19480},
  year   = {2025}
}

备注

ICCV 2025. Project released at: https://mashijie1028.github.io/GenHancer/