中文

Wayformer:通过简单高效的注意力网络进行运动预测

计算机视觉与模式识别 2022-07-14 v1

摘要

自动驾驶中的运动预测是一项具有挑战性的任务,因为复杂的驾驶场景导致静态与动态输入的异质混合。如何将道路几何、车道连通性、时变交通灯状态以及一组动态智能体及其交互的历史信息最优地表示并融合为有效编码,仍是一个开放问题。为建模这一多样化输入特征集合,许多方法提出设计同样复杂的系统,配备多样化的模态特定模块。这导致系统难以扩展、延展或以严格方式调参以权衡质量与效率。本文提出 Wayformer,一系列用于运动预测的基于注意力的简单同质架构。Wayformer 提供紧凑的模型描述,由基于注意力的场景编码器与解码器组成。在场景编码器中,我们研究输入模态的早期、晚期与分层融合选择。针对每种融合类型,我们探索通过分解注意力或潜在查询注意力来权衡效率与质量的策略。我们表明,早期融合尽管构造简单,不仅与模态无关,还在 Waymo Open Motion Dataset(WOMD)与 Argoverse 排行榜上取得最先进结果,证明了我们设计理念的有效性。

关键词

引用

@article{arxiv.2207.05844,
  title  = {Wayformer: Motion Forecasting via Simple & Efficient Attention Networks},
  author = {Nigamaa Nayakanti and Rami Al-Rfou and Aurick Zhou and Kratarth Goel and Khaled S. Refaat and Benjamin Sapp},
  journal= {arXiv preprint arXiv:2207.05844},
  year   = {2022}
}