E3VS-Bench:基于5自由度视点依赖主动感知的3D 高斯溅射场景基准测试
计算机视觉与模式识别
2026-04-24 v2
摘要
3D环境中的视觉搜索要求具身智能体主动探索周围环境并获取任务相关证据。然而,现有视觉搜索和具身AI基准(包括EQA)通常依赖静态观察或受限的第三人称运动,未显式评估在完全5自由度视点控制下可能出现的细粒度视点依赖现象,如由垂直视点位移引起的可见性变化、揭示容器内内容、以及仅从特定角度可观测的对象属性消歧。为此,我们引入E3VS-Bench——一个具身3D视觉搜索基准,要求智能体在5自由度内控制视点以收集视点依赖证据以完成问答。E3VS-Bench包含99个高保真3D场景,使用3D 高斯溅射重建,包含2014个驱动问题剧集。3D 高斯溅射实现保持细粒度视觉细节(如小文本和细微属性)的自由视点渲染,常被网格式模拟器降解,从而允许构建无法从单一视角回答的问题,要求在5自由度内主动检查跨视角。我们评估了多种最先进的视觉语言模型(VLM),并将其性能与人类进行比较。尽管2D推理能力强大,所有模型仍显示出与人类显著的差距,凸显了在完全5自由度视点变更下主动感知和连贯视点规划的局限性。
引用
@article{arxiv.2604.17969,
title = {E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes},
author = {Koya Sakamoto and Taiki Miyanishi and Daichi Azuma and Shuhei Kurita and Shu Morikuni and Naoya Chiba and Motoaki Kawanabe and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2604.17969},
year = {2026}
}
备注
Project page: https://k0uya.github.io/e3vs-proj/