FipTR:一种用于自动驾驶未来实例预测的简单而有效的 Transformer 框架
计算机视觉与模式识别
2024-07-25 v2 机器人学
摘要
从鸟瞰图 (BEV) 角度进行未来实例预测是自动驾驶的重要组成部分,涉及未来实例分割和实例运动预测。现有方法通常依赖于冗余且复杂的流程,需要多个辅助输出和后处理程序。此外,每个辅助预测的估计误差都会导致预测性能下降。在本文中,我们提出了一个简单而有效的完全端到端框架,命名为未来实例预测 Transformer (FipTR),它将任务视为对未来帧的 BEV 实例分割和预测。我们建议采用代表特定交通参与者的实例查询来直接估计相应的未来占用掩码,从而摆脱复杂的后处理程序。此外,我们设计了一个用于未来 BEV 特征预测的流感知 BEV 预测器,由采用后向流引导偏移采样的流感知可变形注意力组成。还提出了一种新颖的未来实例匹配策略,以进一步提高时间连贯性。大量实验证明了 FipTR 的优越性及其在不同时间 BEV 编码器下的有效性。代码可在 https://github.com/TabGuigui/FipTR 获取。
引用
@article{arxiv.2404.12867,
title = {FipTR: A Simple yet Effective Transformer Framework for Future Instance Prediction in Autonomous Driving},
author = {Xingtai Gui and Tengteng Huang and Haonan Shao and Haotian Yao and Chi Zhang},
journal= {arXiv preprint arXiv:2404.12867},
year = {2024}
}