中文

3DRP-Net: 用于三维视觉定位的三维相对位置感知网络

概率论 2024-01-31 v2 偏微分方程分析

摘要

三维视觉定位旨在根据自由形式的语言描述在三维点云中定位目标物体。通常,描述目标物体的语句倾向于提供其与其他物体之间的相对关系信息以及其在整个场景中的位置。本工作中,我们提出一个关系感知的单阶段框架,称为三维相对位置感知网络(3DRP-Net),其能有效捕捉物体间的相对空间关系并增强物体属性。具体而言,1)我们提出三维相对位置多头注意力(3DRP-MA)模块,从物体对语境中不同方向分析相对关系,帮助模型聚焦于语句中提到的特定物体关系。2)我们设计了一种软标注策略,以缓解冗余点引起的空间歧义,并通过恒定且具判别性的分布进一步稳定并增强学习过程。在三个基准(即 ScanRefer 与 Nr3D/Sr3D)上的大量实验表明,我们的方法总体上优于所有 state-of-the-art 方法。源代码将在 GitHub 上发布。

关键词

引用

@article{arxiv.2307.13362,
  title  = {Wasserstein contraction for the stochastic Morris-Lecar neuron model},
  author = {Maxime Herda and Pierre Monmarché and Benoît Perthame},
  journal= {arXiv preprint arXiv:2307.13362},
  year   = {2024}
}