中文

StructXLIP:通过多模态结构线索增强视觉语言模型

计算机视觉与模式识别 2026-03-03 v3 人工智能

摘要

基于边缘的表示是视觉理解的基本线索,这一原则根植于早期视觉研究,至今仍是核心。我们将这一原则扩展到视觉语言对齐,表明在跨模态中隔离和对齐结构线索可以显著提升在长篇细节丰富标题上的微调,特别关注改进跨模态检索。我们引入 StructXLIP,一种微调对齐范式,从边缘图(例如 Canny)中提取结构线索,将其作为图像视觉结构的代理,并筛选相应的标题以强调结构线索,使其“结构中心”。微调将标准对齐损失augmented with 三种结构中心损失:(i)将边缘图与结构文本对齐,(ii)将局部边缘区域匹配到文本块,(iii)将边缘图连接到彩色图像以防止表示漂移。在理论层面,虽然标准 CLIP 通过最大化视觉和文本嵌入之间的互信息实现,但 StructXLIP 还最大化了多模态结构表示之间的互信息。这种辅助优化在本质上更难,引导模型走向更稳健、语义更稳定的最小值,增强视觉语言对齐。除了在通用和特定领域的跨模态检索中超越当前竞争者之外,我们的方法还是一个通用的提升配方,可以即插即用方式集成到未来的方法中。代码和预训练模型已公开:https://github.com/intelligolabs/StructXLIP。

关键词

引用

@article{arxiv.2602.20089,
  title  = {StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues},
  author = {Zanxi Ruan and Songqun Gao and Qiuyu Kong and Yiming Wang and Marco Cristani},
  journal= {arXiv preprint arXiv:2602.20089},
  year   = {2026}
}

备注

Accepted by CVPR 2026