用于开放词汇 3D 目标检测的层次化跨模态对齐
计算机视觉与模式识别
2025-03-11 v1
摘要
开放词汇 3D 目标检测(OV-3DOD)旨在定位和分类超出封闭集合的新型目标。近期视觉语言模型(VLMs)的成功表明,其在理解开放词汇方面具有惊人的能力。现有的工作通常采用会丢失丰富场景上下文的表示方法来进行 3D 目标检测(3DOD),这对于 3D 感知要求极高。为此,本文提出一种层次化框架,称为 HCMA,以同时学习局部目标和全局场景信息用于 OV-3DOD。具体而言,我们首先设计了层次化数据集成(HDI)方法,以获得粗到细的 3D-图像-文本数据,该数据被输入 VLM 以提取目标中心知识。为促进不同层次特征的关联,我们又提出了交互式跨模态对齐(ICMA)策略,以建立有效的同一层次和跨层次特征连接。为更好地跨不同层次对齐特征,我们进一步提出了对象聚焦上下文调整(OFCA)模块,以强调与对象相关的特征来细化多层次特征。大量实验表明,我们的方法在现有的 OV-3DOD 基准测试上优于 SOTA 方法。它甚至在没有任何 3D 标注的情况下也能实现有前景的 OV-3DOD 结果。
引用
@article{arxiv.2503.07593,
title = {Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection},
author = {Youjun Zhao and Jiaying Lin and Rynson W. H. Lau},
journal= {arXiv preprint arXiv:2503.07593},
year = {2025}
}
备注
AAAI 2025 (Extented Version). Project Page: https://youjunzhao.github.io/HCMA/