中文

Lumina-DiMOO:一种全息扩散大型语言模型用于多模态生成与理解

计算机视觉与模式识别 2025-10-09 v1

摘要

我们介绍Lumina-DiMOO,一个开源基础模型,实现多模态生成与理解的无缝融合。Lumina-DiMOO与先前的统一模型不同,采用完全离散扩散建模处理各种模态的输入与输出。这种创新方法使Lumina-DiMOO在计算效率上优于之前的自回归(AR)或混合AR-扩散范式,能够熟练支持广泛的多模态任务,包括文本到图像生成、图像到图像生成(如图像编辑、主体驱动生成和图像填充等),以及图像理解。Lumina-DiMOO在多个基准测试上实现了最先进的性能,超越了现有的开源统一多模态模型。为促进多模态和离散扩散模型研究的进一步发展,我们将代码和模型检查点发布给社区。项目页面:https://synbol.github.io/Lumina-DiMOO。

关键词

引用

@article{arxiv.2510.06308,
  title  = {Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding},
  author = {Yi Xin and Qi Qin and Siqi Luo and Kaiwen Zhu and Juncheng Yan and Yan Tai and Jiayi Lei and Yuewen Cao and Keqi Wang and Yibin Wang and Jinbin Bai and Qian Yu and Dengyang Jiang and Yuandong Pu and Haoxing Chen and Le Zhuo and Junjun He and Gen Luo and Tianbin Li and Ming Hu and Jin Ye and Shenglong Ye and Bo Zhang and Chang Xu and Wenhai Wang and Hongsheng Li and Guangtao Zhai and Tianfan Xue and Bin Fu and Xiaohong Liu and Yu Qiao and Yihao Liu},
  journal= {arXiv preprint arXiv:2510.06308},
  year   = {2025}
}

备注

33 pages, 13 figures, 10 tables