用于场景级监督点云分割的 2D-3D 交错 Transformer
计算机视觉与模式识别
2024-01-23 v2 人工智能
机器学习
摘要
我们提出了一种多模态交错 Transformer(MIT),联合考虑 2D 和 3D 数据用于弱监督点云分割。研究表明 2D 和 3D 特征对点云分割具有互补性。然而,现有方法需要额外的 2D 标注来实现 2D-3D 信息融合。考虑到点云的高标注成本,基于弱监督学习的有效 2D 和 3D 特征融合需求迫切。为此,我们提出了一种具有两个编码器和一个解码器的 transformer 模型,仅使用场景级类别标签进行弱监督点云分割。具体而言,两个编码器分别计算 3D 点云和 2D 多视图图像的自注意力特征。解码器实现交错的 2D-3D 交叉注意力并执行隐式 2D 和 3D 特征融合。我们在解码器层中交替切换查询与键值对的角色。结果表明 2D 和 3D 特征被彼此迭代地丰富。实验表明,在 S3DIS 和 ScanNet 基准上,它大幅优于现有弱监督点云分割方法。项目页面将发布于 https://jimmy15923.github.io/mit_web/。
引用
@article{arxiv.2310.12817,
title = {2D-3D Interlaced Transformer for Point Cloud Segmentation with Scene-Level Supervision},
author = {Cheng-Kun Yang and Min-Hung Chen and Yung-Yu Chuang and Yen-Yu Lin},
journal= {arXiv preprint arXiv:2310.12817},
year = {2024}
}
备注
ICCV 2023 (main + supp). Website: https://jimmy15923.github.io/mit_web/