中文

面向视觉语言对齐的结构感知语言-图像预训练:SLIP

计算机视觉与模式识别 2025-11-06 v1 人工智能

摘要

视觉语言预训练(VLP)在各种下游任务上取得了显著成果,但这些收益主要来自对训练数据的规模提升。然而,现有方法将图像-文本对视为孤立的训练示例,忽略了诸如电子商务产品联购图和社交推荐网络等众多领域中天然存在的丰富关系结构。灵感来自神经科学证据,人类将知识编码为关系认知地图,我们引入结构感知语言-图像预训练(SLIP)。SLIP 集成了结构对比损失以实现跨模态对齐,同时还能在结构图中对相邻实体之间的关系进行建模。为支持这一范式,我们构建了一个大型的亚马逊产品联购多模态图数据集,使规模化的结构跨模态监督成为可能。实验结果表明,SLIP 在零样题和少样题设置下的跨模态检索和分类任务中 consistently 优于 CLIP,显示示了关系监督对跨模态对齐的价值。

关键词

引用

@article{arxiv.2511.03019,
  title  = {SLIP: Structural-aware Language-Image Pretraining for Vision-Language Alignment},
  author = {Wenbo Lu},
  journal= {arXiv preprint arXiv:2511.03019},
  year   = {2025}
}

备注

Capstone Paper