中文

面向大规模三维表示学习:基于多数据集点提示训练

计算机视觉与模式识别 2024-07-23 v2

摘要

深度学习模型的快速发展常归因于其利用海量训练数据的能力。相比之下,这种优势尚未充分惠及三维深度学习,主要由于大规模三维数据集的有限可用性。合并多个可用数据源并让其协同训练单一模型是一种潜在解决方案。然而,由于三维点云数据集间的巨大域差距,这种混合监督可能 adversely 影响模型性能,并导致相比单数据集训练的性能退化(即负迁移)。鉴于此挑战,我们引入点提示训练(PPT),一种用于三维表示学习背景下多数据集协同学习的新框架,支持多种预训练范式。基于该框架,我们提出提示驱动归一化,其通过领域特定提示使模型适应不同数据集,以及语言引导类别对齐,其通过利用标签文本间的关系适度统一多数据集标签空间。大量实验验证 PPT 能克服协同学习相关的负迁移并产生可泛化表示。值得注意的是,它通过有监督多数据集训练使用单一权重共享模型在每个数据集上达到最优性能。此外,作为预训练框架时,它在表示质量上优于其他预训练方法,并在涵盖室内外三维场景的十余项多样下游任务中取得显著的当前最优性能。

关键词

引用

@article{arxiv.2308.09718,
  title  = {Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training},
  author = {Xiaoyang Wu and Zhuotao Tian and Xin Wen and Bohao Peng and Xihui Liu and Kaicheng Yu and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2308.09718},
  year   = {2024}
}

备注

CVPR 2024, code available at Pointcept (https://github.com/Pointcept/Pointcept)