中文

PreGSU:基于预训练图注意力网络的自动驾驶通用交通场景理解模型

计算机视觉与模式识别 2025-04-28 v2 多智能体系统

摘要

场景理解,定义为交通元素间交互的学习、提取和表示,是实现高级自动驾驶(AD)的关键挑战之一。当前的场景理解方法主要关注具体的单一任务,例如轨迹预测和风险等级评估。尽管它们在特定指标上表现良好,但泛化能力不足以适应真实的交通复杂性和下游需求的多样性。在本研究中,我们提出了 PreGSU,一种基于图注意力网络的通用预训练场景理解模型,用于学习交通场景的通用交互和推理,以支持各种下游任务。经过特征工程和子图模块处理后,所有元素被嵌入为节点,形成动态加权图。然后,应用四个图注意力层来学习智能体和车道之间的关系。在预训练阶段,理解模型在两个自监督任务上训练:虚拟交互力(VIF)建模和掩码道路建模(MRM)。基于人工势场理论,VIF 建模使 PreGSU 能够捕获智能体之间的交互,而 MRM 则提取智能体与道路的连接。在微调过程中,加载预训练参数以生成详细的理解输出。我们在三个数据集和两个下游任务(即城市场景中的轨迹预测和高速公路场景中的意图识别)上进行了验证实验,以检验模型的泛化和理解能力。结果表明,与单任务驱动的基线相比,PreGSU 在所有数据集和下游任务上均取得了有竞争力的性能,表明其具有泛化到各种场景和目标的潜力。消融研究显示了预训练任务设计的有效性。

关键词

引用

@article{arxiv.2404.10263,
  title  = {PreGSU-A Generalized Traffic Scene Understanding Model for Autonomous Driving based on Pre-trained Graph Attention Network},
  author = {Yuning Wang and Zhiyuan Liu and Haotian Lin and Junkai Jiang and Shaobing Xu and Jianqiang Wang},
  journal= {arXiv preprint arXiv:2404.10263},
  year   = {2025}
}

备注

14 pages