利用分层全注意力网络从含位姿噪声的二维图像中学习三维语义
计算机视觉与模式识别
2022-04-28 v3
摘要
我们提出一种新颖的框架,从包含位姿误差的二维多视角图像观测中学习三维点云语义。一方面,直接从海量、非结构化且无序的三维点云中学习,比从紧凑组织且上下文丰富的二维 RGB 图像中学习在计算和算法上更困难。另一方面,LiDAR 点云与 RGB 图像均在标准自动驾驶数据集中采集。这促使我们采用一种“任务迁移”范式,使三维语义分割受益于聚合二维语义线索,尽管二维图像观测中含有位姿噪声。在所有困难中,位姿噪声与二维语义分割方法带来的错误预测是任务迁移的主要挑战。为减轻这些因素的影响,我们利用多视角图像感知每个三维点,并为每幅单图像关联一个局部块观测。此外,同时预测一块相邻三维点的语义标签,使我们能够利用点结构先验进一步提升性能。我们设计了一种分层全注意力网络(HiFANet),以顺序聚合局部块、帧袋与点间语义线索,并采用为不同层级语义线索定制的分层注意力机制。而且,每个前置注意力块在送入下一注意力块前大幅缩减特征尺寸,使我们的框架轻量。在 Semantic-KITTI 上的实验结果表明,所提框架显著优于现有基于三维点云的方法,其所需训练数据少得多,且表现出对位姿噪声的容忍度。代码见 https://github.com/yuhanghe01/HiFANet。
引用
@article{arxiv.2204.08084,
title = {Learning 3D Semantics from Pose-Noisy 2D Images with Hierarchical Full Attention Network},
author = {Yuhang He and Lin Chen and Junkun Xie and Long Chen},
journal= {arXiv preprint arXiv:2204.08084},
year = {2022}
}
备注
3D Point Cloud Semantic Segmentation, Semantic Aggregation from Images, Pose Noise