Lavida-O:用于统一多模态理解与生成的弹性大型掩码扩散模型
计算机视觉与模式识别
2025-09-25 v2
摘要
我们提出了 Lavida-O,一个用于多模态理解与生成的统一掩码扩散模型(MDM)。与现有的多模态 MDM(如 MMaDa 和 Muddit)仅支持简单的图像级理解任务和低分辨率图像生成不同,Lavida-O 提出了一个单一框架,能够实现图像级理解、目标定位、图像编辑以及高分辨率(1024px)文本到图像合成。Lavida-O 引入了一种新颖的弹性混合 Transformer(Elastic-MoT)架构,将轻量级生成分支与较大的理解分支相耦合,并辅以 token 压缩、通用文本条件化和分层采样,以实现高效且高质量的生成。Lavida-O 在图像生成和编辑任务中进一步引入了规划与迭代自反思,利用其理解能力无缝提升生成质量。Lavida-O 在包括 RefCOCO 目标定位、GenEval 文本到图像生成和 ImgEdit 图像编辑在内的广泛基准测试上取得了 SOTA 性能,优于现有的自回归模型和连续扩散模型(如 Qwen2.5-VL 和 FluxKontext-dev),同时在推理阶段提供了显著的加速。这些进展确立了 Lavida-O 作为可扩展多模态推理与生成新范式的地位。
引用
@article{arxiv.2509.19244,
title = {Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation},
author = {Shufan Li and Jiuxiang Gu and Kangning Liu and Zhe Lin and Zijun Wei and Aditya Grover and Jason Kuen},
journal= {arXiv preprint arXiv:2509.19244},
year = {2025}
}
备注
31 pages, 15 figures