Co-VisiON: 稀疏室内场景图像集上的共视推理
计算机视觉与模式识别
2025-08-12 v3
摘要
人类展现出识别共视性(即同时出现在多张图像中的3D区域)的卓越能力,即使这些图像在复杂场景中稀疏分布。这种能力是3D视觉和机器人感知的基础,不仅依赖于低级特征匹配,还依赖于高级空间推理和认知整合。然而,当前视觉模型能否复制这种人类级别的能力尚不清楚。本文引入了Co-VisiON基准,旨在评估超过1000个稀疏视角室内场景中受人类启发的共视推理能力。我们的结果表明,尽管共视性常被视为低级特征匹配任务,但在稀疏条件下,现有视觉模型仍面临挑战。值得注意的是,一个专有的视觉-语言模型超越了所有纯视觉基线,但所有模型的表现都远不及人类。这一差距凸显了当前架构的局限性,并激励了需要以类似人类的方式整合空间和语义信息的模型。受人类视觉认知启发,我们提出了一种新颖的多视图基线Covis,它在纯视觉模型中取得了最佳性能,并缩小了与专有VLM的差距。我们希望我们的基准和发现能进一步推动在具有挑战性的稀疏环境中开发具备鲁棒、认知启发推理能力的视觉模型。我们的数据集和源代码可在https://ai4ce.github.io/CoVISION获取。
引用
@article{arxiv.2506.16805,
title = {Co-VisiON: Co-Visibility ReasONing on Sparse Image Sets of Indoor Scenes},
author = {Chao Chen and Nobel Dang and Juexiao Zhang and Wenkai Sun and Pengfei Zheng and Xuhang He and Yimeng Ye and Jiasheng Zhang and Taarun Srinivas and Chen Feng},
journal= {arXiv preprint arXiv:2506.16805},
year = {2025}
}