LTMSformer:用于多智能体轨迹预测的局部趋势感知注意力与运动状态编码Transformer
计算机视觉与模式识别
2025-07-08 v1 人工智能
摘要
对智能体之间复杂的时空依赖关系进行建模以实现轨迹预测一直具有挑战性。由于智能体的每个状态都与相邻时间步的状态密切相关,捕获局部时间依赖关系有利于预测,但大多数研究常常忽略这一点。此外,学习高阶运动状态属性有望增强空间交互建模,但在以往的工作中很少见。为了解决这些问题,我们提出了一个轻量级框架LTMSformer,用于提取多模态轨迹预测的时空交互特征。具体来说,我们引入了一种局部趋势感知注意力机制,通过利用具有分层局部时间框的卷积注意力机制来捕获局部时间依赖关系。接下来,为了建模空间交互依赖关系,我们构建了一个运动状态编码器,以纳入高阶运动状态属性,如加速度、加加速度、航向等。为了进一步细化轨迹预测,我们提出了一个轻量级提案细化模块,该模块利用多层感知器进行轨迹嵌入,并以更少的模型参数生成细化轨迹。在Argoverse 1数据集上的实验结果表明,我们的方法优于基线HiVT-64,将minADE降低了约4.35%,minFDE降低了8.74%,MR降低了20%。与HiVT-128相比,我们还以模型大小减少68%的代价实现了更高的精度。
引用
@article{arxiv.2507.04634,
title = {LTMSformer: A Local Trend-Aware Attention and Motion State Encoding Transformer for Multi-Agent Trajectory Prediction},
author = {Yixin Yan and Yang Li and Yuanfan Wang and Xiaozhou Zhou and Beihao Xia and Manjiang Hu and Hongmao Qin},
journal= {arXiv preprint arXiv:2507.04634},
year = {2025}
}