基于 Transformer 的快速高效鸟瞰图实例预测方法
计算机视觉与模式识别
2026-04-06 v1 机器学习
摘要
精确的目标检测与预测对于确保自动驾驶架构的安全性和效率至关重要。预测目标轨迹和占用使自动驾驶车辆能够利用未来信息预判运动并做出决策,提高其适应性并降低事故风险。当前最先进的(SOTA)方法往往将检测、跟踪和预测阶段隔离,这可能导致由于阶段间累积不准确性而产生的重大预测误差。近期进展通过鸟瞰图(BEV)变换改进了多摄像头感知系统的特征表示,推动了能够从车辆传感器数据直接预测环境元素的端到端系统的发展。然而,这些系统通常面临处理时间长和参数数量多的问题,给实际部署带来挑战。为解决这些问题,本文提出了一种基于简化范式的新型 BEV 实例预测架构,仅依赖实例分割和流预测。所提出的系统优先考虑速度,旨在通过引入高效的基于 Transformer 的架构来减少参数数量和推理时间。此外,所提出的架构实现针对 PyTorch 2.1 版本进行了性能优化。代码和训练模型可在 https://github.com/miguelag99/Efficient-Instance-Prediction 获取。
引用
@article{arxiv.2411.06851,
title = {Fast and Efficient Transformer-based Method for Bird's Eye View Instance Prediction},
author = {Miguel Antunes-García and Luis M. Bergasa and Santiago Montiel-Marín and Rafael Barea and Fabio Sánchez-García and Ángel Llamazares},
journal= {arXiv preprint arXiv:2411.06851},
year = {2026}
}
备注
The article has been presented in the 27th IEEE International Conference on Intelligent Transportation Systems (IEEE ITSC 2024) on September, 2024. Number of pages: 6, Number of figures: 4