中文

GContextFormer:一种面向多模态轨迹预测的全局上下文感知混合多头注意力方法

人工智能 2025-11-25 v1 计算机视觉与模式识别 机器学习 多智能体系统 机器人学 社会与信息网络

摘要

多模态轨迹预测生成多个合理的未来轨迹,以解决车辆运动不确定性问题,这源于意图模糊和执行变异性。然而,依赖 HD 图的模型面临数据获取成本高、更新延迟以及对损坏输入的脆弱性,导致预测失败。无地图的方法缺乏全局上下文,成对注意力过度放大直线模式,同时压制过渡模式,导致运动意图错位。本文提出 GContextFormer,一种即插即用的编码器-解码器架构,采用全局上下文感知混合注意力和比例加法聚合,实现无地图的意图对齐多模态预测。运动感知编码器通过对模式嵌入的轨迹标记进行受限的比例加法聚合来构建场景级意图先验,并在共享全局上下文的基础上细化每个模式的表示,减轻模式间抑制,促进意图对齐。层次化交互解码器将社交推理分解为双路径交叉注意力:标准路径确保代理-模式对的几何覆盖,而邻居上下文增强路径突出突出的交互,带有门控模块调节它们对覆盖-聚焦平衡的贡献。在来自 TOD-VT 数据集的八条高速坡道情景实验中,GContextFormer 在所有基准上均优于最先进的基线方法。与现有 transformer 模型相比,GContextFormer 在高曲率和过渡区域实现更大的鲁棒性和集中化的改进,凭借空间分布实现。通过运动模式区分和邻居上下文调制暴露推理归因,实现可解释性。该模块化架构支持向跨域多模态推理任务的可扩展性。

关键词

引用

@article{arxiv.2511.18874,
  title  = {GContextFormer: A global context-aware hybrid multi-head attention approach with scaled additive aggregation for multimodal trajectory prediction},
  author = {Yuzhi Chen and Yuanchang Xie and Lei Zhao and Pan Liu and Yajie Zou and Chen Wang},
  journal= {arXiv preprint arXiv:2511.18874},
  year   = {2025}
}