中文

Ming-Lite-Uni:面向自然多模态交互的统一架构新进展

计算机视觉与模式识别 2025-06-16 v3

摘要

我们提出了 Ming-Lite-Uni,一个开源多模态框架,其特点是新设计的统一视觉生成器和一个专为统一视觉与语言而定制的原生多模态自回归模型。具体而言,该项目提供了集成 MetaQueries 与 M2-omni 框架的开源实现,同时引入了新颖的多尺度可学习令牌和多尺度表征对齐策略。通过利用一个固定的多模态大语言模型(MLLM)和一个可学习的扩散模型,Ming-Lite-Uni 使原生多模态自回归(AR)模型能够执行文本到图像生成和基于指令的图像编辑任务,将其能力扩展到纯视觉理解之外。我们的实验结果展示了 Ming-Lite-Uni 的强大性能,并说明了其交互过程令人印象深刻的流畅特性。所有代码和模型权重均已开源,以促进社区内的进一步探索。值得注意的是,这项工作与同时期的多模态 AI 里程碑——例如于 2025 年 3 月 25 日更新的具备原生图像生成能力的 ChatGPT-4o——保持一致,凸显了像 Ming-Lite-Uni 这样的统一模型在通往通用人工智能(AGI)道路上的更广泛意义。Ming-Lite-Uni 目前处于 Alpha 阶段,并将很快得到进一步完善。

关键词

引用

@article{arxiv.2505.02471,
  title  = {Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction},
  author = {Inclusion AI and Biao Gong and Cheng Zou and Dandan Zheng and Hu Yu and Jingdong Chen and Jianxin Sun and Junbo Zhao and Jun Zhou and Kaixiang Ji and Lixiang Ru and Libin Wang and Qingpei Guo and Rui Liu and Weilong Chai and Xinyu Xiao and Ziyuan Huang},
  journal= {arXiv preprint arXiv:2505.02471},
  year   = {2025}
}

备注

https://github.com/inclusionAI/Ming/tree/Ming-Lite-Omni-Preview/Ming-unify