探索用于三维点云理解的上下文学习
计算机视觉与模式识别
2023-12-29 v2
摘要
随着在广泛数据上训练的大规模模型的兴起,上下文学习已成为一种新兴学习范式,并在自然语言处理与计算机视觉任务中展现出显著潜力。同时,上下文学习在三维点云领域仍基本未被探索。尽管掩码建模已成功应用于二维视觉中的上下文学习,但直接将其扩展到三维点云仍是一项艰巨挑战。在点云情形下,词元本身即为在推理时被掩码的点云位置(坐标)。此外,先前工作中的位置嵌入可能无意中引入信息泄漏。为应对这些挑战,我们提出一个名为 Point-In-Context 的新颖框架,专为三维点云中的上下文学习设计,其中输入与输出均被建模为各任务的坐标。此外,我们提出联合采样模块,精心设计与通用点采样算子协同工作,有效解决上述技术问题。我们进行了大量实验,以验证所提方法在处理广泛任务时的通用性与适应性。
引用
@article{arxiv.2306.08659,
title = {Explore In-Context Learning for 3D Point Cloud Understanding},
author = {Zhongbin Fang and Xiangtai Li and Xia Li and Joachim M. Buhmann and Chen Change Loy and Mengyuan Liu},
journal= {arXiv preprint arXiv:2306.08659},
year = {2023}
}
备注
Project page: https://github.com/fanglaosi/Point-In-Context