Adapt PointFormer:通过适应 2D 视觉 Transformer 进行 3D 点云分析
计算机视觉与模式识别
2024-08-06 v2
摘要
预训练的大规模模型在计算机视觉中展现出显著的有效性,尤其是在 2D 图像分析方面。然而,在 3D 点云方面,由于数据可达性受限,与海量图像库形成鲜明对比,这给开发 3D 预训练模型的任务带来了挑战。因此,本文尝试直接利用预训练的 2D 模型携带的先验知识来完成 3D 点云分析的任务。为此,我们提出了自适应 PointFormer (APF),通过仅调整少量参数来微调预训练的 2D 模型,以直接处理点云,无需映射到图像。具体而言,我们将原始点云转换为点嵌入,以对齐图像标记的维度。鉴于点云本质上的无序性与图像的结构化特性的差异,我们随后对点嵌入进行排序,以优化 2D 注意力先验的利用。为校准 3D 和 2D 领域之间的注意力并减少计算开销,随后拼接一个参数有限的可训练 PointFormer 到冻结的预训练图像模型上。广泛的实验表明,所提出的 APF 在各种基准测试上均显示出有效性。源代码和更多细节可在 https://vcc.tech/research/2024/PointFormer 查阅。
引用
@article{arxiv.2407.13200,
title = {Adapt PointFormer: 3D Point Cloud Analysis via Adapting 2D Visual Transformers},
author = {Mengke Li and Da Li and Guoqing Yang and Yiu-ming Cheung and Hui Huang},
journal= {arXiv preprint arXiv:2407.13200},
year = {2024}
}
备注
ECAI 2024 main conference paper