中文

Lexicon3D:探针式评估三维场景的视觉基础模型

计算机视觉与模式识别 2025-05-09 v3 人工智能 计算与语言 机器学习 机器人学

摘要

复杂三维场景理解正受到广泛关注,场景编码策略在其中扮演关键角色。然而,针对不同情境的最佳场景编码策略尚不明确,尤其是与其图像基方法的比较仍存疑问。为此,我们提出一项全面研究,探讨各种视觉编码模型在三维场景理解中的作用,揭示各模型在不同情境下的优势与局限。我们的评估覆盖七种视觉基础编码器,包括图像基、视频基与三维基模型。在四项任务中进行评估:视觉-语言场景推理、视觉 grounding、分割与配准,每项任务聚焦场景理解的不同方面。我们的评估结果揭示:DINOv2 表现卓越,视频模型在对象级任务中优势明显,扩散模型对几何任务有益,语言预训练模型在语言相关任务中表现出意外的局限。这些发现挑战了部分既有认知,提供了新的视觉基础模型利用视角,并凸显未来视觉-语言与场景理解任务中更灵活的编码器选择之需求。代码:https://github.com/YunzeMan/Lexicon3D

关键词

引用

@article{arxiv.2409.03757,
  title  = {Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding},
  author = {Yunze Man and Shuhong Zheng and Zhipeng Bao and Martial Hebert and Liang-Yan Gui and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2409.03757},
  year   = {2025}
}

备注

NeurIPS 2024. Project page: https://yunzeman.github.io/lexicon3d Github: https://github.com/YunzeMan/Lexicon3D