EagleVision:基于 BEV 对齐的双阶段链路思考框架用于空间智能
计算机视觉与模式识别
2026-03-23 v2
摘要
基于视频的空间推理——例如从多个视角估计距离、判断方向或理解布局——需要选择有信息的帧,必要时在推理期间主动寻求额外视角。现有的多模态大语言模型(MLLM)消耗固定的均匀采样帧集合,无法在推理开始后请求新视角,往往缺乏可靠空间判断所必需的几何线索。我们提出 EagleVision,一个双阶段框架,结合几何感知帧选择与主动的鸟瞰图(BEV)对齐推理。在第一个阶段(宏观感知),语义-视角-融合决定性点过程(SPF-DPP)在固定 token 预算下选择一组紧凑的关键帧,以最大化语义相关性和视角多样性。在第二个阶段(微观验证),模型执行迭代空间链路思考:在每一步,它可以是在文本中推理或在 BEV 平面上预测姿态以检索最近的真实帧,形成一个闭环假设-观察-验证循环。查询策略仅通过强化学习进行训练,无需人工标注推理痕迹。在 VSI-Bench 和 SQA3D 上,EagleVision 在开源视觉语言模型中实现了最先进的性能。
引用
@article{arxiv.2512.15160,
title = {EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence},
author = {Jiaxu Wan and Xu Wang and Mengwei Xie and Hang Zhang and Mu Xu and Yang Han and Hong Zhang and Ding Yuan and Yifan Yang},
journal= {arXiv preprint arXiv:2512.15160},
year = {2026}
}
备注
Accepted by CVPR 2026