中文

Mamoda2.5:通过 DiT-MoE 提升统一多模态模型

计算机视觉与模式识别 2026-05-05 v1

摘要

我们提出 Mamoda2.5,一个统一的 AR-Diffusion 框架,无缝集成多模态理解与生成于单一架构中。为高效提升模型的生成能力,我们采用细粒度 Mixture-of-Experts (MoE) 设计(128 个专家,Top-8 路由),构建一个 250 亿参数模型,仅激活 30 亿参数,显著降低训练成本的同时扩大模型容量。Mamoda2.5 在 VBench 2.0 上实现顶级生成性能,并在视频编辑质量方面创下新纪录,超越评估的开源模型,匹配当前顶级专有模型的表现,包括 Kling O1 在 OpenVE-Bench 上的表现。此外,我们引入联合的少步蒸馏和强化学习框架,将 30 步编辑模型压缩为 4 步模型,大幅加速模型推理。相较于开源基线,Mamoda2.5 在视频编辑推理速度上提升最高可达 95.9×95.9\times。在实际应用中,Mamoda2.5 已成功部署于广告场景的内容审核和创意修复任务中,在内部广告视频编辑场景中实现 98% 的成功率。

关键词

引用

@article{arxiv.2605.02641,
  title  = {Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE},
  author = {Yangming Shi and Shixiang Zhu and Tao Shen and Zhimiao Yu and Dengsheng Chen and Taicai Chen and Yunfei Yang and Juan Zhou and Chen Cheng and Liang Ma and Xibin Wu and Benxuan Yan and Ge Li and Tuoyu Zhang and Dan Li and Chang Liu and Zhenbang Sun},
  journal= {arXiv preprint arXiv:2605.02641},
  year   = {2026}
}