面向自动驾驶中多模态视频理解的层次化 MamBa 适配
计算机视觉与模式识别
2025-01-09 v1 人工智能
摘要
随着多模态大语言模型(MLLM)的普及,自动驾驶领域遇到了新机遇与挑战。尤其,多模态视频理解对于分析自动驾驶过程中将发生什么事至关重要。然而,包含复杂时空运动的视频受限于现有 MLLM 在该领域的泛化能力。为弥合这一差距,我们提出一种 novel 的层次化 MamBa 适配(H-MBA)框架,以适应自动驾驶视频中复杂的运动变化。具体而言,H-MBA 包含两个模块:Context Mamba(C-Mamba)和 Query Mamba(Q-Mamba)。首先,C-Mamba 包含多种结构状态空间模型,能够有效捕获不同时间分辨率下的多层次视频上下文。其次,Q-Mamba 可灵活将当前帧作为可学习查询,注意性地选择多层次视频上下文进入查询。因此,它能够适应性地整合多尺度时间分辨率的全部视频上下文,以增强视频理解。在 MLLM 的 plug-and-play 范式中,H-MBA 在自动驾驶中的多模态视频任务上显示卓越性能,例如在风险目标检测方面,相较于先前 SOTA 方法提升了 5.5% 的 mIoU。
引用
@article{arxiv.2501.04302,
title = {H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving},
author = {Siran Chen and Yuxiao Luo and Yue Ma and Yu Qiao and Yali Wang},
journal= {arXiv preprint arXiv:2501.04302},
year = {2025}
}
备注
7 pages, 4 figures