重新思考端到端3D感知的时空对齐
计算机视觉与模式识别
2025-12-30 v1
摘要
时空对齐对于自动驾驶(AD)中端到端(E2E)感知的时序建模至关重要,可提供有价值的结构与纹理先验信息。现有方法通常依赖注意力机制跨帧对齐目标,并用统一的显式物理模型(如匀速模型等)简化运动模型。这些方法倾向于利用语义特征进行隐式对齐,挑战了传统感知范式中显式运动建模的重要性。然而,不同类别和不同帧之间的运动状态与目标特征变化使得这种对齐方式并非最优。为解决此问题,我们提出了 HAT,一种时空对齐模块,允许每个目标在无直接监督的情况下从多个假设中自适应地解码出最优对齐提案。具体而言,HAT 首先利用多个显式运动模型为历史实例生成空间锚点和运动感知特征提案。随后,它通过结合缓存目标查询中嵌入的语义和运动线索进行多假设解码,最终为目标帧提供最优对齐提案。在 nuScenes 数据集上,HAT 在多种基线中持续提升了 3D 时序检测器和跟踪器的性能。当与 DETR3D 检测器结合时,在测试集上取得了 46.0% AMOTA 的最先进跟踪结果。在以目标为中心的 E2E AD 方法中,HAT 提高了感知精度(+1.3% mAP,+3.1% AMOTA)并将碰撞率降低了 32%。当语义受损时(nuScenes-C),HAT 对运动建模的增强使得 E2E AD 中的感知与规划更加鲁棒。
引用
@article{arxiv.2512.23635,
title = {Rethinking the Spatio-Temporal Alignment of End-to-End 3D Perception},
author = {Xiaoyu Li and Peidong Li and Xian Wu and Long Shi and Dedong Liu and Yitao Wu and Jiajia Fu and Dixiao Cui and Lijun Zhao and Lining Sun},
journal= {arXiv preprint arXiv:2512.23635},
year = {2025}
}
备注
Accepted to AAAI 2026