Conan:基于多尺度视觉证据的渐进式侦探推理学习
计算机视觉与模式识别
2025-11-21 v2
摘要
视频推理需要在帧间进行多步演绎,这仍然是多模态大语言模型(MLLM)面临的主要挑战。虽然基于强化学习(RL)的方法增强了推理能力,但它们通常依赖于纯文本链,导致产生无根据或幻觉性的结论。相反,帧检索方法引入了视觉基础,但仍然难以准确进行证据定位。为了解决这些局限性,我们提出了Conan,一个基于证据的多步视频推理框架。Conan识别上下文帧和证据帧,推理跨帧线索,并自适应地决定何时得出结论或进一步探索。为了实现这一点,我们 1) 构建了Conan-91K,一个大规模自动生成的推理轨迹数据集,包括帧识别、证据推理和动作决策;2) 设计了一种多阶段渐进式冷启动策略,结合识别-推理-动作(AIR)RLVR训练框架,逐步激励多步视觉推理。在六个多步推理基准上的大量实验表明,Conan在准确率上平均比基线Qwen2.5-VL-7B-Instruct高出10%以上,达到了最先进的性能。此外,Conan能有效泛化到长视频理解任务,验证了其强大的可扩展性和鲁棒性。
引用
@article{arxiv.2510.20470,
title = {Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence},
author = {Kun Ouyang and Yuanxin Liu and Linli Yao and Yishuo Cai and Hao Zhou and Jie Zhou and Fandong Meng and Xu Sun},
journal= {arXiv preprint arXiv:2510.20470},
year = {2025}
}