HAMF:面向联合场景上下文理解与未来运动表示学习的混合注意力-Mamba 框架
计算机视觉与模式识别
2025-05-22 v1 人工智能
摘要
运动预测是自动驾驶系统中的关键挑战,要求准确预测周围智能体的未来轨迹。现有方法通过提取历史智能体轨迹和道路布局的场景上下文特征来预测未来运动状态,但在场景特征编码过程中 suffer from 信息退化。为此,我们提出 HAMF——一种新型运动预测框架,通过联合学习场景上下文编码来学习未来运动表示,实现场景理解与未来运动状态预测的协同结合。首先,我们将观察到的智能体状态和地图信息嵌入为 1D 序列,同时将目标多模态未来运动特征作为一组可学习的 token。随后,我们设计统一的注意力编码器,协同利用自注意力和交叉注意力机制联合建模场景上下文信息与未来运动特征聚合。辅以解码阶段的 Mamba 模块,进一步保留所学习的未来运动表示间的一致性与关联性,以生成准确且多样化的最终轨迹。在 Argoverse 2 数据集上进行的大规模实验表明,HAMF 的混合注意力-Mamba 模型以简洁轻量的架构实现了运动预测的最新性能。
引用
@article{arxiv.2505.15703,
title = {HAMF: A Hybrid Attention-Mamba Framework for Joint Scene Context Understanding and Future Motion Representation Learning},
author = {Xiaodong Mei and Sheng Wang and Jie Cheng and Yingbing Chen and Dan Xu},
journal= {arXiv preprint arXiv:2505.15703},
year = {2025}
}
备注
In submission