中文

动演滚动生物视觉-文本模型中的细粒度文本-视觉对齐

计算机视觉与模式识别 2026-01-29 v1 人工智能

摘要

近期研究表明,将细粒度文本描述与局部图像块对齐可显著提升预训练视觉-语言模型(如 CLIP)的零样基准性能。然而,我们发现,细粒度文本描述和局部图像块常包含冗余信息,导致文本-视觉对齐效果不佳。本文从“视图细化”和“描述细化”两个角度解决此问题,称为 \textit{\textbf{Bi}-refinement for \textbf{F}ine-grained \textbf{T}ext-visual \textbf{A}lignment}(BiFTA)。\emph{视图细化}通过去除 IoU 比率较高的冗余图像块,获得更具辨识度的视觉样本;\emph{描述细化}通过去除两两余弦相似度较高的冗余文本描述,确保剩余描述的多样性。BiFTA 在基于 ViT 和基于 ResNet 的 CLIP 6 个基准数据集上实现卓越的零样性能,证明了在视觉-文本对齐中消除冗余信息的必要性。

关键词

引用

@article{arxiv.2601.20419,
  title  = {Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models},
  author = {Yuhao Sun and Chengyi Cai and Jiacheng Zhang and Zesheng Ye and Xingliang Yuan and Feng Liu},
  journal= {arXiv preprint arXiv:2601.20419},
  year   = {2026}
}

备注

25 pages