中文

面向文本丰富图像理解的基于代码引导的合成多模态数据生成扩放

计算机视觉与模式识别 2025-05-22 v2 计算与语言

摘要

对包含丰富文本(如图表和文档)的图像进行推理,是视觉语言模型(VLM)的一个关键应用领域。然而,VLM 常因文本丰富的视觉语言数据稀缺而在这些领域难以发挥作用。为此,我们提出CoSyn框架,利用文本-only 大语言模型(LLM)的编码能力,自动创建高质量的文本丰富型多模态数据。给定描述目标领域(例如"营养标签")的输入文本,CoSyn 提示 LLM 生成用于渲染合成图像的代码(Python、HTML、LaTeX 等)。凭借代码作为合成图像的文本表示,CoSyn 可再次依赖文本-only LLM 生成高质量指令调优数据。我们使用CoSyn构建了由40万张图片和270万行视觉语言指令调优数据组成的数据集。在七个基准测试中进行的全面实验表明,在我们的合成数据上训练的模型在包括 Llama 3.2 在内的多个开源模型中实现最先进性能,并超越GPT-4V和Gemini 1.5 Flash等专有模型。此外,CoSyn能够生成合成指向数据,使VLM能够对输入图像中的信息进行定位,凸显其在开发具备现实环境行动能力的多模态智能体方面的潜力。

关键词

引用

@article{arxiv.2502.14846,
  title  = {Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation},
  author = {Yue Yang and Ajay Patel and Matt Deitke and Tanmay Gupta and Luca Weihs and Andrew Head and Mark Yatskar and Chris Callison-Burch and Ranjay Krishna and Aniruddha Kembhavi and Christopher Clark},
  journal= {arXiv preprint arXiv:2502.14846},
  year   = {2025}
}

备注

Published in ACL 2025, project page: https://yueyang1996.github.io/cosyn/