UniLiP:适配 CLIP 实现统一的多模态理解、生成与编辑
计算机视觉与模式识别
2026-02-10 v3
摘要
在本文中,我们提出了 UniLiP,一个适配 CLIP 以实现多模态理解、生成和编辑的统一框架。尽管 CLIP 在理解方面表现出色,但它缺乏成为统一视觉编码器所需的重构能力。然而,以往基于 CLIP 的统一方法未能平衡理解与重构,导致语义退化或不一致的重构。相比之下,我们引入了一种带有自蒸馏策略的新型两阶段训练方案,该方案在保持 CLIP 原有理解性能的同时,逐步赋予其高保真重构能力。为了在生成和编辑中增强推理能力和一致性,我们进一步开发了一种建立在 MetaQuery 框架基础上的双条件架构。我们的架构联合利用多模态隐藏状态以获取丰富的上下文细节,并利用可学习的 query embedding 来 harness 多模态大语言模型(MLLM)强大的推理能力。借助先进的图像表示和架构设计,UniLiP 展现出卓越的指令遵循和编辑保真度。仅使用 1B 和 3B 参数,UniLiP 即可优于 BAGEL(7B)和 Uniworld-V1(12B)等更大的统一模型,在 GenEval 上达到 0.90,在 WISE 上达到 0.63,在 ImgEdit 上达到 3.94 的 SOTA 性能。这些结果表明,UniLiP 成功扩展了 CLIP 的应用,确立了其连续特征不仅能作为理解任务的最佳选择,还能在生成和编辑任务中取得极具竞争力的性能。代码和模型可在 https://github.com/nnnth/UniLiP 获取。
引用
@article{arxiv.2507.23278,
title = {UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing},
author = {Hao Tang and Chenwei Xie and Xiaoyi Bao and Tingyu Weng and Pandeng Li and Yun Zheng and Liwei Wang},
journal= {arXiv preprint arXiv:2507.23278},
year = {2026}
}