中文

DC-Scene:面向3D场景理解的数据主义学习方法

计算机视觉与模式识别 2025-05-22 v1

摘要

3D场景理解在机器人、自动驾驶和增强现实等计算机视觉应用中发挥着基本作用。然而,基于学习的3D场景理解仍面临两个关键挑战:(1) 3D场景的规模大和复杂性导致计算成本高、训练速度慢于2D方法;(2) 高质量标注的3D数据集显著稀缺于2D视觉数据。这些挑战凸显了需要更高效学习范式的需求。本文提出DC-Scene,一种针对3D场景理解的数据主义框架,强调提升数据质量和训练效率。具体而言,我们引入了基于CLIP的双指示器质量(DIQ)过滤器,结合视觉语言对齐得分和标题囊惑度,并设计课程调度器逐步扩大训练池从前25%到75%的场景-标题配对。该策略过滤噪声样本,显著减少对大规模标注3D数据的依赖。在ScanRefer和Nr3D上进行大量实验表明,DC-Scene在使用前75%子集时实现了最新性能(86.1 CIDEr vs. 85.4使用完整数据集),同时将训练成本约减2/3,证明紧凑的高质量样本集可超越穷举训练。代码将在https://github.com/AIGeeksGroup/DC-Scene提供。

关键词

引用

@article{arxiv.2505.15232,
  title  = {DC-Scene: Data-Centric Learning for 3D Scene Understanding},
  author = {Ting Huang and Zeyu Zhang and Ruicheng Zhang and Yang Zhao},
  journal= {arXiv preprint arXiv:2505.15232},
  year   = {2025}
}