中文

文本打印图像:弥合图像-文本模态差距以实现大型视觉语言模型的文本中心训练

计算机视觉与模式识别 2025-12-04 v1 人工智能 计算与语言

摘要

近期的大型视觉语言模型(LVLMs)已被应用于多样化的视觉问答(VQA)任务。然而,实现实际性能通常需要针对特定任务进行微调,并需要大量图像-文本对,而收集这些数据成本高昂。在本工作中,我们研究了文本中心训练(text-centric training),这是一种仅提供文本描述而不提供真实图像的设置,作为低成本数据扩展的范式。与图像不同,图像的收集常常受到隐私限制和小众领域稀缺性的制约,而文本则广泛可用。此外,文本易于编辑,可通过大型语言模型(LLM)以最少的精力实现自动多样化和扩展。尽管这在可扩展性和成本方面相比图像收集具有明显优势,但在没有图像的情况下对原始文本进行训练仍只能在VQA任务上产生有限的收益,这是因为图像-文本模态差距的存在。为了解决这一问题,我们提出了文本打印图像(Text-Printed Image, TPI),它通过直接在纯白画布上渲染给定的文本来生成合成图像。这种简单的渲染将文本投影到图像模态中,可以以低成本集成到任意现有的LVLM训练流水线中。此外,TPI保留了文本的语义,而文本到图像模型往往无法做到这一点。在四个模型和七个基准上的系统实验表明,TPI比扩散模型生成的合成图像更能有效支持文本中心训练。我们进一步将TPI探索为一种低成本的数据增强策略,并展示了其实际效用。总体而言,我们的发现揭示了文本中心训练的显著潜力,更广泛地说,为LVLMs的完全自动化数据生成铺平了道路。

关键词

引用

@article{arxiv.2512.03463,
  title  = {Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models},
  author = {Shojiro Yamabe and Futa Waseda and Daiki Shiono and Tsubasa Takahashi},
  journal= {arXiv preprint arXiv:2512.03463},
  year   = {2025}
}