利用GPT-4视觉进行零样本点云理解
计算机视觉与模式识别
2024-01-17 v1 计算与语言
摘要
在本研究中,我们应对了点云中物体类别分类的挑战,以往的工作如PointCLIP由于CLIP架构的固有局限性而难以解决这一问题。我们的方法利用GPT-4视觉(GPT-4V)来克服这些挑战,通过运用其先进的生成能力,实现更具适应性和鲁棒性的分类过程。我们调整了GPT-4V的应用方式以处理复杂的3D数据,使其在不改变底层模型架构的情况下实现零样本识别能力。我们的方法还包括一种用于点云图像可视化的系统化策略,以弥合领域差距并提升GPT-4V的效率。实验验证证明了我们的方法在多种场景下的优越性,为零样本点云分类设立了新的基准。
引用
@article{arxiv.2401.07572,
title = {Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding},
author = {Qi Sun and Xiao Cui and Wengang Zhou and Houqiang Li},
journal= {arXiv preprint arXiv:2401.07572},
year = {2024}
}