VisionTrap:基于文本描述引导的视觉增强轨迹预测
计算机视觉与模式识别
2024-07-18 v1
摘要
预测其他道路车辆的未来轨迹是自动驾驶的 essential 任务。现有的轨迹预测方法主要使用由检测跟踪系统生成的车辆轨迹和HD地图作为输入。本文提出了一种新方法,同时融合来自环视摄像头的视觉输入,使模型能够利用人类视线、手势、道路状况、车辆转向信号等视觉线索,这些线索在先前方法中通常被隐藏。此外,我们使用由视觉语言模型(VLM)生成的文本描述,并由大型语言模型(LLM)细化,作为训练期间的监督信号,以指导模型从输入数据中学习。尽管使用了这些额外的输入,我们的方法实现了53毫秒的延迟,能够实现实时处理,显著快于具有类似性能的先前单车辆预测方法。我们的实验表明,视觉输入和文本描述都对轨迹预测性能的提升有贡献,而我们的定性分析突出了模型如何利用这些额外输入。最后,本文创建并公开了 nuScenes-Text 数据集,将 rich 文本注释增强了 established 的 nuScenes 数据集,展示了利用 VLM 对轨迹预测产生的积极影响。我们的项目页面位于 https://moonseokha.github.io/VisionTrap/
引用
@article{arxiv.2407.12345,
title = {VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual Descriptions},
author = {Seokha Moon and Hyun Woo and Hongbeen Park and Haeji Jung and Reza Mahjourian and Hyung-gun Chi and Hyerin Lim and Sangpil Kim and Jinkyu Kim},
journal= {arXiv preprint arXiv:2407.12345},
year = {2024}
}
备注
Accepted at ECCV 2024