中文

点虚拟变换

计算机视觉与模式识别 2026-02-09 v1

摘要

LiDAR-based 3D目标检测器常常难以检测远场目标,因为点云在长距离范围内稀疏,限制了可靠几何线索的获取。为此,先前方法会从RGB图像中推断深度完成的虚拟点来增强LiDAR数据;然而,直接包含所有虚拟点会增加计算成本,并在有效融合真实与虚拟信息方面引入挑战。我们提出Point Virtual Transformer (PointViT),一个基于变换的3D目标检测框架,联合推理原始LiDAR点和选择性采样的虚拟点。该框架考察了多种融合策略,从早期点级融合到基于BEV的门控融合,并分析了其在准确率和效率之间的权衡。将稠密点云体素化并使用稀疏卷积编码,以形成BEV表示,从中初始化一组高置信度目标查询,并通过变换-based 语境聚合模块进行细化。在KITTI基准测试上,实验报告了Car类的91.16% 3D AP、95.94% BEV AP和99.36% 2D检测基准上的AP。

关键词

引用

@article{arxiv.2602.06406,
  title  = {Point Virtual Transformer},
  author = {Veerain Sood and Bnalin and Gaurav Pandey},
  journal= {arXiv preprint arXiv:2602.06406},
  year   = {2026}
}

备注

8 pages, 4 figures