中文

利用GPT-4视觉进行零样本点云理解

计算机视觉与模式识别 2024-01-17 v1 计算与语言

摘要

在本研究中,我们应对了点云中物体类别分类的挑战,以往的工作如PointCLIP由于CLIP架构的固有局限性而难以解决这一问题。我们的方法利用GPT-4视觉(GPT-4V)来克服这些挑战,通过运用其先进的生成能力,实现更具适应性和鲁棒性的分类过程。我们调整了GPT-4V的应用方式以处理复杂的3D数据,使其在不改变底层模型架构的情况下实现零样本识别能力。我们的方法还包括一种用于点云图像可视化的系统化策略,以弥合领域差距并提升GPT-4V的效率。实验验证证明了我们的方法在多种场景下的优越性,为零样本点云分类设立了新的基准。

关键词

引用

@article{arxiv.2401.07572,
  title  = {Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding},
  author = {Qi Sun and Xiao Cui and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2401.07572},
  year   = {2024}
}