中文

$\beta$-CLIP:多粒度视觉-语言对齐的文本条件对比学习

计算机视觉与模式识别 2026-03-03 v2

摘要

CLIP 通过对齐全局视觉和文本表示实现强大的零样本图像-文本检索,但在微观任务上落后于 fine-tuned 模型,即使在长篇详细描述上亦如此。在本文中,我们提出 β\beta-CLIP,一个多粒度文本条件对比学习框架,旨在实现来自多个文本粒度(从完整描述到句子和短语)及其对应视觉区域之间的层次化对齐。对于每个粒度层级,β\beta-CLIP 利用跨注意力动态池化图像块,产生情境化的视觉嵌入。为解决层次结构中固有的语义重叠,我们引入 β\beta-Contextualized Contrastive Alignment Loss (β\beta-CAL)。该目标参数化严格查询特定匹配与放宽的图像内部情境化之间的权衡,支持软 Cross-Entropy 和硬 Binary Cross-Entropy 两种形式。我们发现,每种损失与层次监督的相互作用不同:CE 的 softmax 锐化了细粒度区分,而 BCE 的 sigmoid 偏好长文本检索,两者都受益于层次结构。通过大量实验,我们展示 β\beta-CLIP 在密集对齐方面显著提升:在 Urban1K 上实现 91.8% T2I 92.3% I2T R@1,在 FG-OVD (Hard) 上达 30.9%,在无硬负例的方法中取得最新成果。β\beta-CLIP 为密集视觉-语言对应关系建立了一个稳健且可适应的基准。代码和模型已发布于 https://github.com/fzohra/B-CLIP。

关键词

引用

@article{arxiv.2512.12678,
  title  = {$\beta$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment},
  author = {Fatimah Zohra and Chen Zhao and Hani Itani and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2512.12678},
  year   = {2026}
}