360{\deg}全景视野下的人类化视觉搜索
计算机视觉与模式识别
2025-11-27 v2
摘要
人类依赖头部(头部运动)和眼睛(眼球运动)的协同控制,才能高效地搜索360{\deg}视野中的视觉信息。然而,现有的视觉搜索方法局限于静态图像,忽略了物理化身及其与3D世界的交互。如何开发出像人类一样高效的具身化视觉搜索智能体,同时规避现实硬件所施加的约束?为此,我们提出了人类化视觉搜索,其中人类化智能体主动旋转头部在以360{\deg}全景图像表示的沉浸式世界中搜索物体或路径。为研究视觉密集的真实世界场景中的视觉搜索,我们构建了H*基准,超越家庭场景,涵盖需要高级视觉-空间推理能力的挑战性户外场景,如交通枢纽、大型零售空间、城市街道和公共机构。我们的实验首先揭示了即使是顶级专有模型,也仅能实现约30%的物体和路径搜索成功率。随后,我们使用后训练技术提升开源Qwen2.5-VL模型的性能,将物体搜索成功率从14.83%提升至47.38%,将路径搜索成功率从6.44%提升至24.94%。值得注意的是,路径搜索的较低上限揭示了其固有的难度,我们归因于对复杂空间常识的需求。我们的结果不仅显示了前进的道路,还量化了在日常生活中无缝集成MLLM智能体所面临的巨大挑战。
关键词
引用
@article{arxiv.2511.20351,
title = {Thinking in 360{\deg}: Humanoid Visual Search in the Wild},
author = {Heyang Yu and Yinan Han and Xiangyu Zhang and Baiqiao Yin and Bowen Chang and Xiangyu Han and Xinhao Liu and Jing Zhang and Marco Pavone and Chen Feng and Saining Xie and Yiming Li},
journal= {arXiv preprint arXiv:2511.20351},
year = {2025}
}
备注
Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar