OmniEgo-R$^2$:面向 CVPR 2026 首届跨域 EgoCross 挑战赛的路由推理框架
计算机视觉与模式识别
2026-05-28 v2
摘要
CVPR 2026 EgoVis 研讨会上的首届跨域 EgoCross 挑战赛评估多模态大语言模型能否对涵盖手术、工业、极限运动和动物视角的自我中心视频进行推理。我们在资源受限赛道和开源赛道中均获得第二名。在本报告中,我们将 EgoCross 定义为一个鲁棒的跨域具身视频推理问题,而非简单的多选视觉问答任务。我们识别出三个关键挑战:(C1)时间边界模糊性,即关键状态转换采样稀疏且常发生在帧间;(C2)跨域语义粒度不匹配,即相同能力需要不同的领域特定视觉语法;(C3)相近选项下的决策不稳定性,即长程多模态推理可能选择无支撑的干扰项或产生格式错误的输出。为解决这些问题,我们提出了 OmniEgo-R(全领域自我中心路由推理),一个统一的路由推理流水线,包含时间证据归一化、领域无关的能力路由、结构化感知-动态-决策推理、边界感知选项验证以及防御性答案校准。OmniEgo-R 使用在每个 EgoCross 领域上微调的 Qwen3-VL-4B-SFT 检查点作为视觉-语言骨干,并为其封装了轻量级的测试时推理和解析程序。我们最终提交的结果在资源受限赛道和开源赛道分别取得了 66.35% 和 66.77% 的整体准确率,在两个排行榜上均排名第二。代码已开源在 https://github.com/Lee-zixu/OmniEgo-R2。
引用
@article{arxiv.2605.24481,
title = {OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026},
author = {Zixu Li and Zhiwei Chen and Zhiheng Fu and Wenbo Wang and Yupeng Hu and Weili Guan and Liqiang Nie},
journal= {arXiv preprint arXiv:2605.24481},
year = {2026}
}
备注
Technical Report for the 1st Cross-Domain EgoCross Challenge at CVPR 2026