中文

MORE:用于3D场景密集描述的多阶关系挖掘

计算机视觉与模式识别 2022-07-21 v2 人工智能 计算与语言

摘要

3D密集描述是一项近期提出的新颖任务,其中点云比2D对应物包含更多几何信息。然而,由于点云中包含更高复杂度和更广种类的物体间关系,该任务也更具挑战性。现有方法仅将这些关系作为图中物体特征学习的副产品而未专门编码,导致次优结果。本文旨在通过对3D场景中复杂关系的捕获与利用来改进3D密集描述,提出MORE,一种多阶关系(Multi-Order RElation)挖掘模型,以支持生成更具描述性与全面性的描述。技术上,我们的MORE以渐进方式编码物体关系,因为复杂关系可由有限个基本关系推导得出。我们首先设计一种新颖的空间布局图卷积(SLGC),其将若干一阶关系语义编码为构建于3D物体提议上的图的边。接下来,从所得图中进一步提取封装基本一阶关系的多个三元组作为基本单元,并构建若干以物体为中心的三元组注意力图(OTAG)来推断每个目标物体的多阶关系。来自OTAG的更新节点特征被聚合并送入描述解码器以提供丰富的关系线索,从而可生成包含与上下文物体的多样关系的描述。在Scan2Cap数据集上的大量实验证明了我们提出的MORE及其组件的有效性,并且我们也优于当前最优(state-of-the-art)方法。我们的代码见 https://github.com/SxJyJay/MORE。

关键词

引用

@article{arxiv.2203.05203,
  title  = {MORE: Multi-Order RElation Mining for Dense Captioning in 3D Scenes},
  author = {Yang Jiao and Shaoxiang Chen and Zequn Jie and Jingjing Chen and Lin Ma and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2203.05203},
  year   = {2022}
}

备注

Accepted by ECCV 2022