MammothModa2:用于多模态理解与生成的统一 AR-Diffusion 框架
计算机视觉与模式识别
2025-11-25 v1
摘要
统一多模态模型旨在集成理解与生成,但在离散语义推理与高保真视觉合成之间的鸿沟仍具有挑战性。我们提出了 MammothModa2(Mammoth2),一个统一的自回归-扩散(AR-Diffusion)框架,旨在有效耦合自回归语义规划与扩散生成。Mammoth2 采用串行设计:一个配备生成专家的 AR 路径对离散标记进行全局语义建模,而单流 Diffusion Transformer(DiT)解码器处理高保真图像合成。我们设计的 AR-Diffusion 特征对齐模块结合了多层特征聚合、统一条件编码和上下文条件编码,以稳定地将 AR 的表示与扩散解码器的连续潜在表示对齐。Mammoth2 通过联合 Next-Token Prediction 和 Flow Matching 目标进行端到端训练,随后进行监督微调和在生成与编辑方面的强化学习。虽然不依赖预训练生成器,Mammoth2 仅用约 6000 万监督生成样本,便在公开基准测试中实现强劲的文本到图像和指令式编辑性能,GenEval 达到 0.87,DPGBench 达到 87.2,ImgEdit 达到 4.06,同时在多模态理解任务上与 Qwen3-VL-8B 等理解-only 主干网络保持竞争力。这一结果表明,精心耦合的 AR-Diffusion 架构能够在单一的、在参数和数据方面都高效的模型中提供高保真生成和编辑,同时保持强大的多模态理解能力。
引用
@article{arxiv.2511.18262,
title = {MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation},
author = {Tao Shen and Xin Wan and Taicai Chen and Rui Zhang and Junwen Pan and Dawei Lu and Fanding Lei and Zhilin Lu and Yunfei Yang and Chen Cheng and Qi She and Chang Liu and Zhenbang Sun},
journal= {arXiv preprint arXiv:2511.18262},
year = {2025}
}