MTA:面向鸟瞰图感知与描述的多模态任务对齐
计算机视觉与模式识别
2025-03-12 v2 人工智能
计算与语言
机器学习
摘要
基于鸟瞰图(BEV)的3D感知在自动驾驶应用中起着至关重要的作用。大语言模型的兴起激发了人们对基于BEV的描述以理解周围环境中物体行为的兴趣。然而,现有方法将感知和描述视为独立任务,仅关注单一任务的性能,忽视了多模态对齐的潜在益处。为了弥合模态间的这一差距,我们提出了MTA,一个新颖的多模态任务对齐框架,可同时提升BEV感知和描述的性能。MTA包含两个关键组件:(1)BEV-语言对齐(BLA),一种将BEV场景表示与真实语言表示对齐的上下文学习机制;(2)检测-描述对齐(DCA),一种将检测和描述输出对齐的跨模态提示机制。MTA在训练期间无缝集成到最先进的基线模型中,在运行时不会增加额外的计算复杂度。在nuScenes和TOD3Cap数据集上的大量实验表明,MTA在这两项任务上均显著优于最先进的基线模型,在具有挑战性的稀有感知场景中实现了10.7%的提升,在描述任务上实现了9.2%的提升。这些结果突显了统一对齐在协调基于BEV的感知与描述方面的有效性。
引用
@article{arxiv.2411.10639,
title = {MTA: Multimodal Task Alignment for BEV Perception and Captioning},
author = {Yunsheng Ma and Burhaneddin Yaman and Xin Ye and Jingru Luo and Feng Tao and Abhirup Mallik and Ziran Wang and Liu Ren},
journal= {arXiv preprint arXiv:2411.10639},
year = {2025}
}
备注
10 pages