BEV-TSR:自动驾驶中BEV空间的文本-场景检索
计算机视觉与模式识别
2024-06-19 v2 人工智能
摘要
自动驾驶行业的快速发展导致了自动驾驶数据的大量积累。因此,对数据检索以提供专门优化的需求日益增长。然而,直接应用先前的图像检索方法面临若干挑战,例如缺乏全局特征表示以及对复杂驾驶场景的文本检索能力不足。为了解决这些问题,首先,我们提出了BEV-TSR框架,该框架利用描述性文本作为输入,在鸟瞰图(BEV)空间中检索相应场景。然后,为了促进具有大量文本描述的复杂场景检索,我们采用大型语言模型(LLM)提取文本输入的语义特征,并融入知识图谱嵌入以增强语言嵌入的语义丰富性。为了实现BEV特征与语言嵌入之间的特征对齐,我们提出了共享跨模态嵌入,使用一组共享的可学习嵌入来弥合这两种模态之间的差距,并采用字幕生成任务进一步增强对齐。此外,缺乏良好格式的检索数据集用于有效评估。为此,我们基于广泛采用的nuScenes数据集建立了一个多级检索数据集nuScenes-Retrieval。在多级nuScenes-Retrieval上的实验结果表明,BEV-TSR实现了最先进的性能,例如,场景到文本和文本到场景检索的top-1准确率分别为85.78%和87.66%。代码和数据集将公开。
引用
@article{arxiv.2401.01065,
title = {BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving},
author = {Tao Tang and Dafeng Wei and Zhengyu Jia and Tian Gao and Changwei Cai and Chengkai Hou and Peng Jia and Kun Zhan and Haiyang Sun and Jingchen Fan and Yixing Zhao and Fu Liu and Xiaodan Liang and Xianpeng Lang and Yang Wang},
journal= {arXiv preprint arXiv:2401.01065},
year = {2024}
}