中文

Dynin-Omni:面向全模态的统一大扩散语言模型

计算与语言 2026-04-02 v1 计算机与社会 信息检索 机器学习

摘要

我们提出Dynin-Omni,首个基于掩码扩散的全模态基础模型,统一了文本、图像和语音理解与生成,同时包含视频理解。与序列化异构模态的自回归统一模型或需依赖外部模态特定解码器的组合式统一模型不同,Dynin-Omni原生地将全模态建模形式化为共享离散标记空间上的掩码扩散,实现基于双向上下文的迭代细化。Dynin-Omni采用多阶段训练策略,包括模型合并式模态扩展和全模态对齐。我们在19个多模态基准测试上评估Dynin-Omni,涵盖语言推理、图像生成与编辑、视频理解和语音识别与合成。Dynin-Omni在GSM8K上达到87.6,在MME-P上达到1733.6,在VideoMME上达到61.4,在GenEval上达到0.87,在LibriSpeech test-clean上达到2.1 WER,持续超越现有开源统一模型,同时与强大的模态特定专家系统保持竞争力。这一结果表明,掩码扩散作为一种用于任意到任意建模的统一范式具有潜力,为实时全模态系统、统一跨模态检索与生成以及具身多模态智能体提供了灵活的基础。

关键词

引用

@article{arxiv.2604.00006,
  title  = {Scalable Identification and Prioritization of Requisition-Specific Personal Competencies Using Large Language Models},
  author = {Wanxin Li and Denver McNeney and Nivedita Prabhu and Charlene Zhang and Renee Barr and Matthew Kitching and Khanh Dao Duc and Anthony S. Boyce},
  journal= {arXiv preprint arXiv:2604.00006},
  year   = {2026}
}