中文

Point-In-Context:通过上下文学习理解点云

计算机视觉与模式识别 2026-03-24 v3

摘要

大规模模型的兴起促进了上下文学习作为多任务处理的一种强大方法,特别是在自然语言和图像处理领域。然而,其在3D点云任务中的应用尚未得到充分探索。在本文中,我们介绍了Point-In-Context(PIC),一个利用标准Transformer架构进行上下文学习的3D点云理解的开创性框架。PIC独特地能够在单一统一训练阶段后执行多个任务,无需微调。为了将掩码点建模扩展到3D上下文学习,我们引入了联合采样模块,这是一种简单而有效的技术,强调了输入和目标之间的映射关系。PIC将输入和目标都视为基于坐标的,通过将标签点与每个类别的预定义XYZ坐标关联来解决分割挑战。然而,依赖这种固定的标签-坐标分配限制了模型泛化到未见领域的能力。为了解决这一限制,我们进一步提出了两种创新的训练策略:上下文标记和上下文增强。这些策略被整合到PIC++中,增强了动态上下文标记和模型训练。除了多任务能力外,PIC++通过使用动态上下文标签和常规上下文对,展示了在部件分割数据集上的泛化能力。值得注意的是,PIC++经过一次训练无需微调,可以通过定制提示有效泛化到未见数据集并执行新颖的部件分割。总体而言,PIC是一个通用框架,通过上下文学习以统一数据格式无缝集成额外任务或数据集。大量实验证明了PIC在处理多样任务和同时分割多个数据集方面的多功能性和适应性。

关键词

引用

@article{arxiv.2404.12352,
  title  = {Point-In-Context: Understanding Point Cloud via In-Context Learning},
  author = {Mengyuan Liu and Zhongbin Fang and Xia Li and Joachim M. Buhmann and Deheng Ye and Xiangtai Li and Chen Change Loy},
  journal= {arXiv preprint arXiv:2404.12352},
  year   = {2026}
}

备注

Project page: https://fanglaosi.github.io/Point-In-Context_Pages. arXiv admin note: text overlap with arXiv:2306.08659