SMART:基于下一词预测的可扩展多代理实时运动生成
机器人学
2024-11-04 v3 计算机视觉与模式识别
摘要
数据驱动的自主驾驶运动生成任务常受数据集规模限制以及数据集之间的领域差距的影响,这些限制阻碍了其在实际场景中的广泛应用。为此,我们引入了SMART,这是一种新的自主驾驶运动生成范式,通过将向量化地图和代理人轨迹数据建模为离散序列标记,并通过仅包含解码器的Transformer架构训练以进行跨时空序列的下一词预测任务。这种GPT风格的方法使模型能够学习真实驾驶场景中的运动分布。SMART在生成式 Sim Agents 挑战中的大多数指标上实现了最先进的性能,在Waymo Open Motion Dataset (WOMD) 和 Sim Agents 挑战排行榜中名列第1,显示出卓越的推理速度。此外,SMART在自主驾驶运动领域中表现出零样例泛化能力:仅使用NuPlan数据集进行训练,对WOMD进行验证时,SMART在Sim Agents挑战中取得了0.72的竞争性分数。最后,我们收集了来自多个数据集的超过10亿条运动标记,验证了模型的可扩展性。这些结果表明,SMART最初已模拟了两个重要属性:可扩展性和零样例泛化,初步满足大规模实时仿真应用的需求。我们已发布所有代码,以推动自主驾驶领域运动生成模型的探索。源代码可在 https://github.com/rainmaker22/SMART 查看。
关键词
引用
@article{arxiv.2405.15677,
title = {SMART: Scalable Multi-agent Real-time Motion Generation via Next-token Prediction},
author = {Wei Wu and Xiaoxin Feng and Ziyan Gao and Yuheng Kan},
journal= {arXiv preprint arXiv:2405.15677},
year = {2024}
}
备注
Accepted by NeurIPS 2024