中文

自动驾驶中的视觉 Transformer 综述:当前趋势与未来方向

计算机视觉与模式识别 2024-03-13 v1 机器学习

摘要

本综述探讨了视觉 Transformer 模型在自动驾驶领域的适应情况,这一过渡是受其在自然语言处理领域成功经验驱动的。它们在诸如顺序图像处理等任务中超越了传统的循环神经网络,并在全局上下文捕获方面超越了卷积神经网络,如在复杂场景识别中所证明。在自动驾驶领域,实时、动态的视觉场景处理至关重要。我们的综述提供了关于视觉 Transformer 在自动驾驶中应用的全面概述,重点关注自注意力、多头注意力和编码器-解码器架构等基础概念。我们涵盖了目标检测、分割、行人检测、车道检测等应用,比较了它们的架构优势与局限。本综述以展望未来研究方向为结论,强调了视觉 Transformer 在自动驾驶中日益重要的作用。

关键词

引用

@article{arxiv.2403.07542,
  title  = {A Survey of Vision Transformers in Autonomous Driving: Current Trends and Future Directions},
  author = {Quoc-Vinh Lai-Dang},
  journal= {arXiv preprint arXiv:2403.07542},
  year   = {2024}
}

备注

9 pages, 3 figures