中文

AnySynth:面向通用视觉语言任务的图像合成数据生成

计算机视觉与模式识别 2024-12-03 v2

摘要

扩散模型最近被用于生成高质量图像,减少了对手动数据收集的需求,并改进了目标检测、实例分割和图像感知等任务中的模型泛化能力。然而,合成框架通常由于对图像布局、内容和标注格式的各种要求,需要进行细致的人为工作为每个任务设计,从而限制了合成数据在更通用场景中的应用。在本文中,我们提出了AnySynth,一个统一的框架,集成了可适应、全面且高度可控的组件,能够根据给定的多样化需求生成任意类型的合成数据。具体而言,首先引入了任务特定布局生成模块,通过利用大型语言模型的生成能力和真实世界图像的布局先验,为不同任务产生合理的布局。然后开发了通用受控图像生成模块,以基于生成布局的方式创建可控且高质量的合成图像。此外,可以将用户特定的参考图像和风格图像纳入生成以满足任务要求。最后,任务导向的标注模块为生成的图像在不同任务上提供精确和详细的标注。我们在各种任务上验证了框架的性能,包括零样本目标检测、跨域目标检测、零样本组合图像检索和多模态图像感知与定位。我们框架合成的特定数据显著提高了这些任务中模型的性能,展示了框架的通用性和有效性。

关键词

引用

@article{arxiv.2411.16749,
  title  = {AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks},
  author = {You Li and Fan Ma and Yi Yang},
  journal= {arXiv preprint arXiv:2411.16749},
  year   = {2024}
}