中文

CLIPoint3D:基于 CLIP 的语言引导少样本无监督 3D 点云域适应

计算机视觉与模式识别 2026-04-22 v2 机器学习

摘要

最近的视觉语言模型(VLM)如 CLIP 在跨模态推理方面表现突出,已扩展至 3D 感知。然而,这些模型在域迁移下仍显脆弱,尤其是在从合成数据迁移到真实点云时。传统的 3D 域适应方法依赖重型可训练编码器,虽然准确率高,但牺牲了效率。我们引入 CLIPoint3D,首个基于 CLIP 的少样本无监督 3D 点云域适应框架。该方法将 3D 样本投影到多个深度图,利用冻结的 CLIP 主干网络,通过集成高阶语言先验与轻量 3D 编码器几何线索的知识驱动提示调优方案进行细化。为有效适应任务特定特征,我们对 CLIP 编码器应用参数高效微调,并设计熵导视角采样策略以选择置信度更高的投影。此外,optimal transport 基于对齐损失和不确定性感知原型对齐损失协同工作,弥合源-目标分布差距,同时保持类别可分性。在 PointDA-10 和 GraspNetPC-10 数据集上进行大量实验表明,CLIPoint3D 在 CLIP 基线和传统编码器基线上均实现 3%-16% 的准确率提升。项目页面:https://sarthakm320.github.io/CLIPoint3D。

关键词

引用

@article{arxiv.2602.20409,
  title  = {CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation},
  author = {Mainak Singha and Sarthak Mehrotra and Paolo Casari and Subhasis Chaudhuri and Elisa Ricci and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2602.20409},
  year   = {2026}
}

备注

Accepted in CVPR 2026