基于 Transformer 的双目图像立体感知三维目标检测
计算机视觉与模式识别
2024-10-10 v4
摘要
Transformer 已在多种视觉目标检测任务中展现出可喜进展,包括单目 2D/3D 检测与环视 3D 检测。更重要的是,Transformer 模型中的注意力机制与双目立体中的 3D 信息提取均基于相似性。然而,将现有基于 Transformer 的检测器直接用于双目立体 3D 目标检测会导致收敛缓慢与精度显著下降。我们认为该缺陷的一个关键原因是现有 Transformer 忽略了双目立体特有的图像对应信息。本文探讨 Transformer 在双目 3D 目标检测中的模型设计,尤其关注任务特定的图像对应信息的提取与编码。为此,我们提出 TS3D,一种基于 Transformer 的立体感知 3D 目标检测器。在 TS3D 中,提出视差感知位置编码(DAPE)模块,将图像对应信息嵌入立体特征。该对应被编码为归一化亚像素级视差,并与正弦 2D 位置编码结合以提供场景的 3D 位置信息。为丰富多尺度立体特征,我们提出立体保持特征金字塔网络(SPFPN)。SPFPN 旨在融合尺度内并聚合跨尺度立体特征的同时保持对应信息。我们提出的 TS3D 在 KITTI 测试集上取得 41.29% 的中等难度车辆检测平均精度,并以 88 ms 处理每对双目图像检测目标。其在精度与推理速度上均与先进同类方法具有竞争力。
引用
@article{arxiv.2304.11906,
title = {Transformer-based stereo-aware 3D object detection from binocular images},
author = {Hanqing Sun and Yanwei Pang and Jiale Cao and Jin Xie and Xuelong Li},
journal= {arXiv preprint arXiv:2304.11906},
year = {2024}
}
备注
Accepted by IEEE T-ITS