中文

基于视觉-语言模型的广义少样本3D点云分割

计算机视觉与模式识别 2025-05-21 v2

摘要

广义少样本3D点云分割(GFS-PCS)利用少量支持样本使模型适应新类,同时保留基类分割。现有 GFS-PCS 方法通过与支持或查询特征交互来增强原型,但仍受限于少样本样本带来的稀疏知识。同时,3D视觉-语言模型(3D VLMs)在开放世界新类上具有泛化能力,包含丰富但带噪的新类知识。在本工作中,我们引入了一个 GFS-PCS 框架,将 3D VLM 生成密集但带噪的伪标签与精确但稀疏的少样本样本相结合,以最大化两者的优势,命名为 GFS-VL。具体而言,我们提出了一种原型引导的伪标签选择方法来过滤低质量区域,随后采用自适应填充策略,结合伪标签上下文知识与少样本样本,对过滤后的未标记区域进行自适应标记。此外,我们设计了一种新-基类混合策略,将少样本样本嵌入训练场景中,保留必要的上下文以改善新类学习。此外,鉴于当前 GFS-PCS 基准测试的多样性有限,我们引入了两个包含多样新类的挑战性基准,用于全面的泛化评估。实验验证了我们的框架在不同模型和数据集上的有效性。我们的方法和基准为推进 GFS-PCS 在真实世界中的应用奠定了坚实基础。代码位于 https://github.com/ZhaochongAn/GFS-VL

关键词

引用

@article{arxiv.2503.16282,
  title  = {Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model},
  author = {Zhaochong An and Guolei Sun and Yun Liu and Runjia Li and Junlin Han and Ender Konukoglu and Serge Belongie},
  journal= {arXiv preprint arXiv:2503.16282},
  year   = {2025}
}

备注

Accepted to CVPR 2025