中文

UniVL:用于空间对齐 的 统一 视觉-语言 嵌入

计算机视觉与模式识别 2026-05-22 v1 机器学习

摘要

我们提出了空间对齐的上下文图像生成,这是一种可控图像生成任务,重新构建条件范式。不再通过两个独立的编码器(一个用于视觉,一个用于语言)提供参考图像和全局文本提示,而是 UniVL 在从单个统一视觉输入中直接将语义绑定到空间位置,文本指令被渲染到空间掩码上。这一做法在推理阶段消除了独立的文本编码器的需求。 resulting model supports contextual image generation by following user-specified instructions about what should appear where, while substantially reducing computation. 为解决这一任务,我们提出了框架,其中 UniVL 编码器(源自光学字符识别预训练骨干网络)从统一条件中进行光学读取,产生 UniVL 嵌入 fVIL,将视觉与语义意图与空间位置融合于单个 token 序列中。two-stage pipeline first aligns UniVL with the VAE embedding space and then conditions a pretrained diffusion backbone entirely on UniVL embeddings, eliminating the standalone text encoder, such as T5. 虽然这种重新构建使用刻意简化的文本界面,却实现了显著的经验性提升。在我们为训练和评估构建的 47.7 万掩码标注图像基准数据集 UniVL-ImgGen 上,UniVL 在文本提示基线方法上实现更好的图像质量,FID 从 14 降至 11,PSNR 从 16 提升至 20。它还完全消除了文本编码器的使用,推理 TFLOPs 降低最高可达 52%,运行时间缩短最高可达 44%。额外的消融研究验证了所提方法组件的贡献,为以统一条件范式实现高效空间对齐图像生成铺平了道路。

关键词

引用

@article{arxiv.2605.21611,
  title  = {UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation},
  author = {Jiayun Wang and Yu Wang and Weijie Gan and Zhenting Wang and Wei Wei},
  journal= {arXiv preprint arXiv:2605.21611},
  year   = {2026}
}