SpatiO:面向空间推理的视觉语言智能体自适应测试时编排
计算机视觉与模式识别
2026-04-29 v2
摘要
理解视觉场景不仅需要识别物体,还需要推理其空间关系。与一般视觉语言任务不同,空间推理需要整合多种归纳偏置,包括2D外观线索、深度信号和几何约束,其可靠性在不同情境下各不相同。这表明有效的空间推理需要空间适应性:根据输入灵活协调不同推理策略的能力。然而,大多数现有方法依赖单一推理管道,隐式学习固定的空间先验,限制了其在分布变化下的适应能力。多智能体系统提供了可行的替代方案,通过聚合多样化的推理轨迹实现推理,但先前尝试在空间推理中主要采用同质智能体,限制了其能利用的归纳偏置多样性。本文引入SpatiO,一个用于空间推理的异构多智能体框架,协调多个具有互补归纳偏置的视觉语言专家。为实现有效协作,我们提出了测试时编排(TTO),一种优化机制,在推理期间动态评估和重新加权各智能体的可靠性,而无需修改模型参数。广泛的实验测试于多样化的空间推理基准中,包括3DSRBench、STVQA-7k、CV-Bench和Omni3D-Bench,表明SpatiO在封闭源和开放源基准中均显著优于空间推理性能。
引用
@article{arxiv.2604.21190,
title = {SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning},
author = {Chan Yeong Hwang and Miso Choi and Sunghyun On and Jinkyu Kim and Jungbeom Lee},
journal= {arXiv preprint arXiv:2604.21190},
year = {2026}
}
备注
Technical report