DONUT:面向轨迹预测的解码器专用模型
计算机视觉与模式识别
2025-08-04 v2
摘要
预测场景中其他智能体的运动对于自动驾驶汽车的预测至关重要,因为它允许车辆 anticipation 未来。灵感来自解码器模型在语言建模中的成功,我们提出了 DONUT,即面向轨迹展开的解码器专用网络。与现有的编码器-解码器预测模型不同,我们使用单个自回归模型对历史轨迹进行编码并预测未来轨迹。这使得模型能够以一致的方式进行迭代预测,并始终提供最新信息,从而提升性能。此外,灵感来自语言建模中的多标记预测,我们引入了“overprediction”策略,赋予模型预测更长时间范围内的轨迹的辅助任务。这使得模型能够更好地 anticipation 未来,进一步提高性能。通过实验,我们展示了我们的解码器专用方法优于编码器-解码器基线,并在 Argoverse 2 单智能体运动预测基准中取得新的最先进成绩。
引用
@article{arxiv.2506.06854,
title = {DONUT: A Decoder-Only Model for Trajectory Prediction},
author = {Markus Knoche and Daan de Geus and Bastian Leibe},
journal= {arXiv preprint arXiv:2506.06854},
year = {2025}
}
备注
ICCV 2025. Project page at https://vision.rwth-aachen.de/donut