从合成数据中学习以用于视觉定位
计算机视觉与模式识别
2024-12-17 v2 计算与语言
机器学习
摘要
本文广泛研究了合成训练数据在提升视觉与语言模型将文本描述定位到图像区域能力方面的有效性。我们探索了在不同设置和对真实数据不同程度依赖下,使用一系列预训练模型生成图像-文本对和图像-文本-框三元组的最佳策略。通过与合成数据、真实数据和网络爬取数据的对比分析,我们找出了导致性能差异的因素,并提出了 SynGround,一种用于生成有用视觉定位合成数据的有效流水线。我们的研究结果表明,SynGround 能够提升现成视觉与语言模型的定位能力,并提供了任意大规模数据生成的潜力。特别是,使用 SynGround 生成的数据在 RefCOCO+ 和 Flickr30k 基准上,分别将预训练 ALBEF 和 BLIP 模型的指向游戏准确率绝对提升了 4.81% 和 17.11%。
引用
@article{arxiv.2403.13804,
title = {Learning from Synthetic Data for Visual Grounding},
author = {Ruozhen He and Ziyan Yang and Paola Cascante-Bonilla and Alexander C. Berg and Vicente Ordonez},
journal= {arXiv preprint arXiv:2403.13804},
year = {2024}
}
备注
Project Page: https://catherine-r-he.github.io/SynGround/