中文

面向交错式视觉语言通用模型的模态专用协同器

计算与语言 2025-06-10 v2 计算机视觉与模式识别

摘要

近期视觉语言模型 (VLM) 的进展导致了能够理解和生成文本与图像的视觉语言通用模型 (VLG) 的出现。然而,对于当前 VLGs 而言, seamless 生成任意序列的文本和图像仍是一个具有挑战性的任务。主要限制之一在于同时对离散文本标记和连续图像特征采用统一的架构和相同的参数集合。近期研究尝试通过引入模态感知专家模型来解决这一根本问题,但它们采用相同的架构处理文本和图像,忽略了这两种模态固有的归纳偏置。在本工作中,我们引入模态专用协同器 (MOSS),一种新型设计,有效地优化了 VLGs 的统一架构,采用模态专用的适应层,即用于建模图像图像块局部先验的卷积 LoRA 和用于处理序列文本的线性 LoRA。该设计能够更有效地建模模态特定特征,同时保持来自预训练的强大跨模态集成。此外,为提高在交错文本-图像生成上的指令跟随能力,我们引入 LEAFINSTRUCT,这是第一个开源的交错指令调优数据集,包含 184,982 条高质量实例,覆盖超过 10 个多样化领域。广泛的实验表明,集成 MOSS 的 VLGs 在复杂交错生成任务中实现了最先进的性能,显著超越基准 VLGs。 Furthermore, our method exhibits strong generalizability on different VLGs。

关键词

引用

@article{arxiv.2407.03604,
  title  = {Modality-Specialized Synergizers for Interleaved Vision-Language Generalists},
  author = {Zhiyang Xu and Minqian Liu and Ying Shen and Joy Rimchala and Jiaxin Zhang and Qifan Wang and Yu Cheng and Lifu Huang},
  journal= {arXiv preprint arXiv:2407.03604},
  year   = {2025}
}

备注

8 Pages, interleaved instruction tuning, parameter-efficient tuning, image understanding, image generation