中文

OmniScene:面向自动驾驶的注意力增强多模态4D场景理解

计算机视觉与模式识别 2025-09-26 v2

摘要

人类视觉能够将二维观察转化为以自身为中心的三维场景理解,这是实现复杂场景翻译并展现自适应行为的基础。然而,当前自动驾驶系统仍缺乏这一能力,主流方法主要依赖基于深度的3D重建,而非真正的场景理解。为此,我们提出一种类人框架OmniScene。首先,引入OmniScene视觉语言模型(OmniVLM),集成多视角和时序感知,实现整体4D场景理解。随后,基于教师-学生OmniVLM架构和知识蒸馏,将文本表示嵌入3D实例特征中,以实现语义监督,丰富特征学习,显式捕获类人注意力语义。这些特征表示进一步与人类驾驶行为对齐,构建更具类人感知-理解-行动架构。此外,我们提出层次化融合策略(HFS),解决多模态集成中各模态贡献的不平衡问题。该方法在多个抽象层级上自适应校准几何特征与语义特征的相对重要性,实现视觉模态和文本模态互补线索的协同利用。这种可学习的动态融合实现了对异构信息的更细致且更有效的利用。我们在nuScenes数据集上对OmniScene进行全面评估, benchmark其与十余个最新模型在各种任务上的表现。我们的做法在感知、预测、规划和视觉问答等任务上均实现了优异结果,树立了新的基准。

关键词

引用

@article{arxiv.2509.19973,
  title  = {OmniScene: Attention-Augmented Multimodal 4D Scene Understanding for Autonomous Driving},
  author = {Pei Liu and Hongliang Lu and Haichao Liu and Haipeng Liu and Xin Liu and Ruoyu Yao and Shengbo Eben Li and Jun Ma},
  journal= {arXiv preprint arXiv:2509.19973},
  year   = {2025}
}