CLIP 类模型作为基础密度比估计器
计算机视觉与模式识别
2025-12-01 v2
摘要
密度比估计是统计机器学习中的核心概念,因为它提供了重要加权、散度估计和无似然推断等任务的统一机制,但其在视觉和语言模型中的潜力尚未得到充分挖掘。现代视觉语言编码器如 CLIP 和 SigLIP 通过对比目标训练,隐式地优化联合图像-文本分布与边际分布之间的对数密度比,从而隐式学习与对数密度比成正比的相似度得分。然而,先前工作主要聚焦于其嵌入效用,密度比结构尚未在多模态应用中系统性地检验或利用。为填补这一空白,我们重新解释 CLIP 类模型作为预训练的通用密度比估计器,并展示这种视角如何开启新的算法能力。我们提出了对对比目标如何估计密度比的统一解释,提出两种实际应用:重要加权学习和 KL 散度估计。我们的重要加权学习方法仅需一个额外的提示即可将 F1 分数提升最高 7 分。我们进一步表明,CLIP 基于的密度比支持估计 KL 散度,这量化了对图像或文本进行条件化如何改变另一模态的分布。通过定性示例和 N-gram 分析,我们发现这些散度捕捉了多模态数据中的语义多样性和模式结构。基于此属性,我们引入一种简单的 KL 指导数据修饰方法,性能与 LAION2B 过滤相竞争。
引用
@article{arxiv.2506.22881,
title = {CLIP-like Model as a Foundational Density Ratio Estimator},
author = {Fumiya Uchiyama and Rintaro Yanagi and Shohei Taniguchi and Shota Takashiro and Masahiro Suzuki and Hirokatsu Kataoka and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2506.22881},
year = {2025}
}