中文

FASTer:面向长期 3D 目标检测的焦点标记获取与缩放 Transformer

计算机视觉与模式识别 2025-03-05 v1 人工智能

摘要

近期基于激光雷达的顶级性能时序 3D 检测器日益采用基于区域的范式,即首先生成粗糙的提案,然后对区域特征进行编码和融合。然而, indiscriminate sampling 和 fusion 常常忽略单个点的不同贡献,随输入帧数增长而导致复杂度指数级增加。此外,任意的结果级拼接限制了全局信息的提取。本文提出了一种 Focal Token Acquiring-and-Scaling Transformer (FASTer),其动态选择焦点标记并以自适应且轻量级方式对 token 序列进行压缩。强调单个 token 的贡献,我们提出一种简单而有效的自适应缩放机制,以捕获几何上下文,同时筛选出焦点点。对历史帧中仅存储和处理焦点点可显著降低总体复杂度。进一步提出一种新颖的分层融合策略,逐步执行序列缩放和 intra-group 融合运算,以促进全局空间和时间信息的交换。在 Waymo Open Dataset 上的实验表明,FASTer 在性能和效率方面均显著优于其他最先进的检测器,同时表现出更好的灵活性和鲁棒性。代码已公开于 https://github.com/MSunDYY/FASTer.git。

关键词

引用

@article{arxiv.2503.01899,
  title  = {FASTer: Focal Token Acquiring-and-Scaling Transformer for Long-term 3D Object Detection},
  author = {Chenxu Dang and Zaipeng Duan and Pei An and Xinmin Zhang and Xuzhong Hu and Jie Ma},
  journal= {arXiv preprint arXiv:2503.01899},
  year   = {2025}
}

备注

10pages,6 figures