中文

用于三维视觉定位的点-语言层次对齐学习

计算机视觉与模式识别 2023-06-12 v4

摘要

本文提出一种新颖的层次对齐模型(HAM),以端到端方式学习多粒度的视觉与语言表示。我们提取关键点与候选点来建模三维上下文与实例,并提出带上下文调制(PLACM)机制的点-语言对齐,该机制逐步将词级与句级语言嵌入与视觉表示对齐,同时借助视觉上下文的调制捕捉潜在的 informative 关系。为进一步捕捉全局与局部关系,我们提出一种空间多粒度建模方案,将 PLACM 应用于全局与局部场。实验结果表明了 HAM 的优越性,可视化结果显示其能动态建模细粒度视觉与语言表示。HAM 以显著优势超越现有方法,在两个公开数据集上达到 state-of-the-art 性能,并荣获 ECCV 2022 ScanRefer 挑战赛冠军。代码见~\url{https://github.com/PPjmchen/HAM}。

关键词

引用

@article{arxiv.2210.12513,
  title  = {Learning Point-Language Hierarchical Alignment for 3D Visual Grounding},
  author = {Jiaming Chen and Weixin Luo and Ran Song and Xiaolin Wei and Lin Ma and Wei Zhang},
  journal= {arXiv preprint arXiv:2210.12513},
  year   = {2023}
}

备注

Champion on ECCV 2022 ScanRefer Challenge