中文

基于动态模块和语言导向空间注意力的多目标3D定位

计算机视觉与模式识别 2024-12-23 v2

摘要

多目标3D定位涉及根据给定查询短语从点云中定位3D框。这是一个具有诸多应用于视觉理解、人机交互和机器人领域的具有挑战性和重要性的任务。为解决这一挑战,我们引入D-LISA,一种两阶段方法,包含三个创新点:第一,一个动态视觉模块,使框提议数量可变且可学习;第二,一个动态相机定位,提取每个提议的特征;第三,一个语言导向空间注意力模块,更好地对提议进行推理以输出最终预测。实验结果表明,我们的方法在多目标3D定位方面优于最新方法12.8%(绝对值),在单目标3D定位方面表现出竞争力。

关键词

引用

@article{arxiv.2410.22306,
  title  = {Multi-Object 3D Grounding with Dynamic Modules and Language-Informed Spatial Attention},
  author = {Haomeng Zhang and Chiao-An Yang and Raymond A. Yeh},
  journal= {arXiv preprint arXiv:2410.22306},
  year   = {2024}
}

备注

NeurIPS 2024