中文

ProxyTransformation:利用代理注意力预塑点云流形以实现三维视觉定位

计算机视觉与模式识别 2025-02-28 v2

摘要

具身智能要求智能体能够根据语言指令与三维环境进行实时交互。该领域的一项基础任务是自我中心的三维视觉定位。然而,从 RGB-D 图像渲染的点云保留了大量的冗余背景数据和固有噪声,这两者都可能干扰目标区域的流形结构。现有的点云增强方法通常需要繁琐的过程来改善流形,这不适用于实时任务。我们提出了适用于多模态任务的 Proxy Transformation,以高效地改善点云流形。我们的方法首先利用可变形点聚类来识别目标区域中的点云子流形。然后,我们提出了一个代理注意力模块,利用多模态代理来引导点云变换。基于代理注意力,我们设计了一个子流形变换生成模块,其中文本信息全局地引导不同子流形的平移向量,优化目标区域的相对空间关系。同时,图像信息引导每个子流形内的线性变换,细化目标区域的局部点云流形。大量实验表明,Proxy Transformation 显著优于所有现有方法,在简单目标上实现了 7.49% 的显著提升,在困难目标上实现了 4.60% 的提升,同时将注意力模块的计算开销降低了 40.6%。这些结果在自我中心的三维视觉定位中建立了新的 SOTA,展示了我们方法的有效性和鲁棒性。

关键词

引用

@article{arxiv.2502.19247,
  title  = {ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding},
  author = {Qihang Peng and Henry Zheng and Gao Huang},
  journal= {arXiv preprint arXiv:2502.19247},
  year   = {2025}
}

备注

12 pages, 3 figures. Accepted by CVPR2025