Omni-o3:深度嵌套式全模态推理的音视频推理
计算机视觉与模式识别
2026-04-28 v1
摘要
全模态理解包含大量高度冗余的跨模态交互,需要聚焦且深入的推理。当前的推理范式依赖于顺序逐步生成或并行逐样本rollout,导致推理轨迹孤立。这种无法共享有前景中间路径的能力严重限制了探索效率,并在复杂音视频任务中导致复合性错误。为突破这一瓶颈,我们引入Omni-o3,这是一种驱动深度嵌套推理策略的新框架。将推理形式化为动态递归搜索,Omni-o3本质上在分支间共享推理前缀,使我们能够迭代执行四个原子认知动作:扩展、选择、模拟和反向传播。为赋能该框架,我们提出了健壮的两阶段训练范式:(1)在350万个多样化全模态样本中蒸馏得到10.1万个高质量长链轨迹上的冷启动监督微调,实现必要的递归搜索模式;(2)在1.8万个复杂多轮样本上进行基于嵌套组rollout的探索性强化学习,由新颖的多步骤奖励模型显式引导深层嵌套推理。广泛的实验表明,Omni-o3在11个基准测试上实现了竞争性能,解锁了在综合音视频、视觉中心和音频中心推理任务中的先进能力。
引用
@article{arxiv.2604.24191,
title = {Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning},
author = {Zhicheng Zhang and Wentao Gu and Weicheng Wang and Yongjie Zhu and Wenyu Qin and Meng Wang and Pengfei Wan and Jufeng Yang},
journal= {arXiv preprint arXiv:2604.24191},
year = {2026}
}