预测未来:基于知识图谱的自动驾驶场景理解基石模型
计算与语言
2025-03-25 v1
摘要
自动驾驶领域在 various topics(如目标识别、轨迹预测和运动规划)方面取得了显著进展。然而,当前方法在有效理解驾驶场景随时间的复杂演变方面存在局限。本文提出了 FM4SU,一种 novel 方法,用于训练自动驾驶场景理解的符号基石模型(FM)。它利用知识图谱(KGs)来捕获感知观察以及诸如道路拓扑、交通规则或交通参与者之间复杂互动等 domain knowledge。从 KG 中提取每个驾驶场景的鸟瞰视图(BEV)符号表示,包括场景之间对象之间的时空信息。将 BEV 表示序列化为一系列 token,并输入预训练的语言模型(PLMs)以学习驾驶场景元素之间内在的 co-occurrence 以及对下一场景的预测。我们使用 nuScenes 数据集和 KG 在 various 场景中进行了大量实验。结果表明,微调的模型在所有任务中均实现了显著提高的准确率。微调的 T5 模型在下一场景预测中的准确率达到了 86.7%。本文得出结论,FM4SU 为开发更全面的场景理解模型提供了有前景的基石。
引用
@article{arxiv.2503.18730,
title = {Predicting the Road Ahead: A Knowledge Graph based Foundation Model for Scene Understanding in Autonomous Driving},
author = {Hongkuan Zhou and Stefan Schmid and Yicong Li and Lavdim Halilaj and Xiangtong Yao and Wei cao},
journal= {arXiv preprint arXiv:2503.18730},
year = {2025}
}