Omni-R1:迈向统一的多模态推理生成范式
人工智能
2026-04-21 v2
摘要
多模态大语言模型(MLLMs)在多模态推理方面取得了显著进展。早期方法侧重于纯文本推理。近期的研究已将多模态信息纳入推理步骤;然而,它们通常遵循单一的任务特定推理模式,这限制了其在各种多模态任务上的泛化能力。事实上,存在大量需要多样化推理技能的多模态任务,例如放大图像的特定区域或在图像中标记物体。为解决这一问题,我们提出了统一生成式多模态推理,通过在推理过程中生成中间图像来统一多样化的多模态推理技能。我们通过 Omni-R1 实例化了这一范式,这是一个包含感知对齐损失和感知奖励的两阶段 SFT+RL 框架,从而实现了功能性图像生成。此外,我们还引入了 Omni-R1-Zero,它通过从纯文本推理数据中引导逐步可视化,消除了对多模态标注的需求。实验结果表明,Omni-R1 在广泛的多模态任务上实现了统一的生成式推理,而 Omni-R1-Zero 的平均性能可匹敌甚至超越 Omni-R1,为生成式多模态推理指明了一个有前景的方向。
引用
@article{arxiv.2601.09536,
title = {Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning},
author = {Dongjie Cheng and Yongqi Li and Zhixin Ma and Hongru Cai and Yupeng Hu and Wenjie Wang and Liqiang Nie and Wenjie Li},
journal= {arXiv preprint arXiv:2601.09536},
year = {2026}
}
备注
Accepted by ACL2026 Findings