NExT-OMNI:基于离散流匹配的任意-任意全模态基础模型
计算与语言
2025-10-17 v2 人工智能
计算机视觉与模式识别
多媒体
摘要
下一代具备任意-任意跨模态生成和多轮交互能力的多模态基础模型将作为人工通用智能系统的核心组件,在人机交互中发挥关键作用。然而,现有大多数多模态模型仍受限于自回归架构,其固有局限性阻碍了理解与生成能力的平衡集成。虽然探索了混合和解耦策略以在统一框架中分别处理这些任务,但其冗余且非集成的设计限制了其在更广泛场景(如跨模态检索)的适用性。在本工作中,我们引入 NExT-OMNI,一个开源全模态基础模型,通过离散流范式实现统一建模。利用度量诱导的概率路径和动力学最优速度,NExT-OMNI 原生支持任意-任意理解与生成,同时通过简洁的统一表示而非任务解耦设计,实现更广泛的应用场景。该模型在大规模交错文本、图像、视频和音频数据上训练,能够在多模态生成和理解基准测试中提供具竞争力的性能,并在多轮多模态交互和跨模态检索中超越先前统一模型,凸显其作为下一代多模态基础模型的架构优势。为推动进一步研究,我们公开了训练细节、数据协议以及开源代码和模型检查点。
引用
@article{arxiv.2510.13721,
title = {NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching},
author = {Run Luo and Xiaobo Xia and Lu Wang and Longze Chen and Renke Shan and Jing Luo and Min Yang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2510.13721},
year = {2025}
}