Omni-R1:基于双系统协作的强化学习全模态推理
计算机视觉与模式识别
2025-05-27 v1
摘要
长时程视频-音频推理与细粒度像素理解对全模态模型提出了相互冲突的要求:密集的时间覆盖需要许多低分辨率帧,而精确定位则需要高分辨率输入。我们通过双系统架构来解决这一权衡:全局推理系统以低空间成本选择信息丰富的关键帧并重写任务,而细节理解系统在选定的高分辨率片段上执行像素级定位。由于“最优”关键帧选择和重写是模糊且难以监督的,我们将其表述为强化学习(RL)问题,并提出了Omni-R1,这是一个基于Group Relative Policy Optimization构建的端到端RL框架。Omni-R1通过与细节理解系统的在线协作获取分层奖励来训练全局推理系统,仅需在小任务划分上进行一轮RL训练。在两个具有挑战性的基准测试,即指代音视频分割(RefAVS)和推理视频目标分割(REVOS)上的实验表明,Omni-R1不仅超越了强大的监督基线,还优于专门的SOTA模型,同时显著提高了域外泛化能力并缓解了多模态幻觉。我们的结果证明了RL在大规模全模态推理中的首次成功应用,并突出了迈向通用基础模型的可扩展路径。
引用
@article{arxiv.2505.20256,
title = {Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration},
author = {Hao Zhong and Muzhi Zhu and Zongze Du and Zheng Huang and Canyu Zhao and Mingyu Liu and Wen Wang and Hao Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2505.20256},
year = {2025}
}
备注
Project page: https://aim-uofa.github.io/OmniR1