中文

UniFusion:视觉语言模型作为图像生成的统一编码器

计算机视觉与模式识别 2025-10-15 v1 人工智能 机器学习

摘要

尽管最近在视觉生成方面的进展取得了显著成果,但大多数现有架构仍依赖于图像和文本的独立编码器。这种分离限制了扩散模型进行跨模态推理和知识迁移的能力。先前的尝试常通过 VLM 的最后一层信息、采用多个视觉编码器或为文本和图像生成共同训练大型统一模型,后者需要大量计算资源和大规模数据,限制了可及性。我们提出 UniFusion,一种基于冻结的大型视觉语言模型(VLM)的扩散生成模型,其作为统一的多模态编码器。UniFusion 的核心是 Layerwise Attention Pooling(LAP)机制,从冻结 VLM 的文本和视觉 token 中提取高层语义与低层细节,用于条件化扩散生成模型。我们证明 LAP 在文本-图像对齐生成和从 VLM 向扩散模型传递视觉信息方面优于其他浅层融合架构,这是编辑关键的能力。我们提出 VLM-Enabled Rewriting Injection with Flexible Inference(VERIFI),该方法仅在 VLM 在推理期间生成的文本 token 上条件化扩散变换器(DiT)。VERIFI 将条件分布对齐与 VLM 的推理能力相结合,提高了推理过程的能力和灵活性。此外,在编辑任务上的微调不仅改善了文本-图像生成的对齐,表明跨模态知识迁移,还展现出显著的泛化能力。我们的模型在单张图像编辑训练后,零样本可泛化到多个图像参考,这进一步动机了 UniFusion 的统一编码器设计。

关键词

引用

@article{arxiv.2510.12789,
  title  = {UniFusion: Vision-Language Model as Unified Encoder in Image Generation},
  author = {Kevin Li and Manuel Brack and Sudeep Katakol and Hareesh Ravi and Ajinkya Kale},
  journal= {arXiv preprint arXiv:2510.12789},
  year   = {2025}
}

备注

Project page at https://thekevinli.github.io/unifusion/