盲盒外绘:为视觉定位合成与选择训练数据的策略
计算机视觉与模式识别
2025-04-22 v2 人工智能
机器学习
摘要
视觉定位旨在基于文本查询局部化图像区域。鉴于大规模数据 curated 的困难,本文研究如何在数据稀缺设置下有效学习视觉定位。为解决数据稀缺问题,我们提出一种新框架POBF(Paint Outside the Box and Filter),通过对盒子外进行插图来合成图像,解决以往工作中遇到的标签错位问题。此外,POBF 利用一种创新的过滤方案选择最有效的训练数据。该方案结合硬度得分和过拟合得分,并通过惩罚项进行平衡。跨四个基准数据集的大量实验表明,POBF 持续地提高了性能,相较于仅使用真实数据的方法实现了平均提升5.83%,在准确率上超过领先基线2.29%-3.85%。此外,我们验证了POBF 在各种生成模型、训练数据规模和模型架构下的鲁棒性和可泛化性。
引用
@article{arxiv.2412.00684,
title = {Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding},
author = {Zilin Du and Haoxin Li and Jianfei Yu and Boyang Li},
journal= {arXiv preprint arXiv:2412.00684},
year = {2025}
}