SPATIOROUTE:面向零样本空间推理的动态提示路由
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
基于第一人称视角视频的空间问答是一项具有挑战性的任务,要求视觉-语言模型(VLM)对 3D 物体位置、场景可供性及方向关系进行推理,尤其是在没有任务特定微调的零样本设置下。我们引入了 SpatioRoute,这是一种动态提示生成方法,可将每个传入的问题路由到语义定制的提示模板——无需任何额外训练、微调或 3D 传感器输入。SpatioRoute 以两种互补模式运行:SpatioRoute-R 是一个基于规则的路由器,将问题类型学(例如 What、Is、How、Can、Which)确定性地映射到专门的提示模板;SpatioRoute-L 是一种由 LLM 驱动的方法,仅根据问题和情境上下文生成任务特定的提示,在路由时无需视频输入。我们在 SQA3D 基准上跨不同模型系列的 VLM 评估了 SpatioRoute。与固定提示基线相比,SpatioRoute 实现了高达 5% 的总体准确率持续提升,在不要求 3D 点云输入的情况下,为零样本纯视频空间 VQA 创立了新的 SOTA。作为额外发现,我们观察到通过 Think it Twice 架构实现的思维链提示,在此设置下会持续降低 Qwen 系列模型的性能,这证实了对于空间视频理解,问题感知路由比统一推理指令更有效。
引用
@article{arxiv.2605.18209,
title = {SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning},
author = {Pawat Chunhachatrachai and Gueter Josmy Faure and Hung-Ting Su and Winston H. Hsu},
journal= {arXiv preprint arXiv:2605.18209},
year = {2026}
}
备注
10 pages, 2 figures, 2nd Workshop on 3D-LLM/VLA, CVPR 2026