中文

以视觉-语言模型为基础的合成数据生成

计算机视觉与模式识别 2026-05-05 v2 人工智能

摘要

深度学习模型受益于数据多样性和规模的增加,推动合成数据增强以改进现有数据集。然而,现有的合成数据评估指标通常计算潜在特征相似性,这难以解释且不总是与下游任务的贡献相关。我们提出一种基于视觉-语言的框架,用于远程感知领域的可解释合成数据增强和评估。我们的 метод结合生成模型、语义分割和图像描述生成,与视觉-语言模型结合。基于此框架,我们引入 ARAS400k:一个大规模远程感知数据集,包含 100k 真实图像和 300k 合成图像,每个图像配有分割图和描述。ARAS400k 启用了合成数据自动评估,通过分析语义组成、最小化描述冗余,验证视觉结构与语言描述之间的跨模态一致性。实验结果表明,仅使用合成数据训练的模型可达到具有竞争力的性能水平,但使用增强后数据 (真实图像与合成图像的组合) 训练的模型在始终优于真实数据基准。因此,该工作为远程感知任务,特别是语义分割和图像描述提供了一个可扩展的基准。数据集可在 zenodo.org/records/18890661 获取,代码基地位于 github.com/caglarmert/ARAS400k。

关键词

引用

@article{arxiv.2603.09625,
  title  = {Grounding Synthetic Data Generation With Vision and Language Models},
  author = {Ümit Mert Çağlar and Alptekin Temizel},
  journal= {arXiv preprint arXiv:2603.09625},
  year   = {2026}
}

备注

Accepted for presentation at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Synthetic Data for Computer Vision Workshop (SynData4CV) 2026