标题到底说了什么?基于反事实短语干预的视觉语言预训练中的组合数据选择
计算机视觉与模式识别
2026-05-22 v1
摘要
CLIP 风格的对比预训练通常使用基于样本级筛选信号(通常基于配对水平对齐)来精选大规模图像文本对。我们表明,该信号存在饱和现象:一旦去除较粗糙的不匹配,更严格的全局筛选便不再与保留文本中提供的组合监督保持一致。原因在于结构性的——全局评分混合了配对广泛可信度与单个对象、属性和关系短语是否实质性支持图像文本匹配的两类判断。后者是组合泛化所需的,而配对级过滤器却对其一无所知。我们通过反事实短语干预 (Counterfactual Phrase Intervention, CPI) 提出了一种短语级筛选框架,将受控的 nonce-token 替换转换为图像条件化的短语灵敏度评分。CPI 只使用全局对齐进行粗糙不匹配的移除,然后按 caption 短语在受控替换下对图像文本分数有无实质影响进行排序。我们将 CPI 视为一种一阶短语灵敏度信号,而非依据或识别结果,在 CC3M 规模上进行评估。按该信号排序后,50% 数据子集在 VL-CheckList-VG Relation 上比完整数据基线提升 +1.91,比仅基于对齐的筛选在相同预算下提升 +1.00,同时改善 SugarCrepe 的整体表现并保持通用迁移。CPI 与损失函数正交:应用于 NegCLIP 时,VL-CheckList-VG Relation 再提升 +3.84,同时在主文本中获得额外的 CE-CLIP 增益。
引用
@article{arxiv.2605.22651,
title = {What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining},
author = {Hyejin Go and Semi Lee and Hyesong Choi},
journal= {arXiv preprint arXiv:2605.22651},
year = {2026}
}
备注
11 pages, 2 figures, 4 tables. Preprint