中文

通过多模态合成数据提升视觉-语言组合理解

计算机视觉与模式识别 2025-04-01 v2

摘要

带有微妙差异的图像-文本配对数据(例如,持 surfboard 的人 vs. 持 shovel 的人)有望产生具备正确组合理解能力的视觉-语言模型。由于数据收集成本较低, 从生成模型合成此类训练数据因此备受青睞。然而,合成用于组合学习的训练图像存在三个挑战:(1) 大规模图像生成的效率;(2) 在微妙变化位置的文本与生成图像之间的对齐;(3) 确保生成图像与原始真实图像在其他位置的足够相似性。我们提出了 SPARCL(Synthetic Perturbations for Advancing Robust Compositional Learning),将图像特征注入快速文本到图像生成模型,随后进行图像风格迁移,以满足这三个挑战。进一步,为了应对文本对齐的残余问题,我们提出了自适应边际损失,以过滤潜在不正确的合成样本,聚焦于信息性硬样本的学习。在四个组合理解基准测试上进行评估,SPARCL 在 CLIP 的组合性方面显著优于现有方法,平均准确率提升超过 8%,在三个基准测试中均优于最新方法 2%。

关键词

引用

@article{arxiv.2503.01167,
  title  = {Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data},
  author = {Haoxin Li and Boyang Li},
  journal= {arXiv preprint arXiv:2503.01167},
  year   = {2025}
}