中文

OpenScan:通用开放词汇 3D 场景理解基准

计算机视觉与模式识别 2025-11-26 v4

摘要

开放词汇 3D 场景理解(OV-3D)旨在定位和分类超出封闭对象类别集合的新型对象。然而,现有方法和基准主要聚焦于对象类别范围内的开放词汇问题,这在为模型对 3D 场景理解程度提供全面评估方面已不足。本文引入了更具挑战性的任务——通用开放词汇 3D 场景理解(GOV-3D),以探索超越对象类别的开放词汇问题。它包含以语言查询形式表达的开放且多样的广义知识,涵盖细粒度和对象特定属性。为此,我们贡献了一个新的基准,名为 \textit{OpenScan},其中包含跨八个代表性语言方面的 3D 对象属性,包括可 affordance、property 和 material。我们进一步在 OpenScan 基准上评估了最新方法的 OV-3D 性能,发现这些方法在理解 GOV-3D 任务中抽象词汇方面困难,这一挑战无法仅通过扩大对象类别训练来解决。我们指出了现有方法的局限性,并探索了克服这些短板的有前景方向。

关键词

引用

@article{arxiv.2408.11030,
  title  = {OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding},
  author = {Youjun Zhao and Jiaying Lin and Shuquan Ye and Qianshi Pang and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2408.11030},
  year   = {2025}
}

备注

Accepted by AAAI 2026. Project Page: https://youjunzhao.github.io/OpenScan/