图像于句子中:用于统一交错指令的图像生成
计算机视觉与模式识别
2026-05-13 v1
摘要
虽然最近的多模态语言模型进展使从富有表现力的多图像指令生成图像方面取得了显著进展,但现有方法在面对复杂交错指令时仍难以保持性能。这种限制源于当前范式中图像与文本结构分离的事实,迫使模型建立困难的长程依赖以匹配描述与视觉目标。为此,我们提出 \texttt{I}mages i\texttt{N} \texttt{SE}n\texttt{T}ences(即 INSET),一种将图像作为原生词汇自然嵌入文本指令中的统一生成模型。通过将视觉特征置于其对应的语义槽位 directly,INSET 利用 transformer 的语境局部性实现精确的对象绑定,有效地将图像视为稠密、富有表现力的语言标记。进一步,我们引入一个可扩展数据引擎,从标准图像和视频数据集合成 1500 万高质量交错样本,利用 VLM 和 LLM 构建丰富、长程序列。InterleaveBench 上的评估结果表明,INSET 在多图像一致性和文本对齐方面显著优于最先进的方法,随输入复杂度的增加,性能差距也在扩大。除标准生成外,我们的方法天然扩展到多模态图像编辑,将视觉内容作为指令的一部分,以实现高度富有表现力和创造性的视觉操作。
关键词
引用
@article{arxiv.2605.12305,
title = {Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation},
author = {Yabo Zhang and Kunchang Li and Dewei Zhou and Xinyu Huang and Xun Wang},
journal= {arXiv preprint arXiv:2605.12305},
year = {2026}
}