SGFormer:用于基于点云的3D场景图生成的语义图Transformer
计算机视觉与模式识别
2023-12-21 v3
摘要
本文中,我们提出了一种称为SGFormer的新模型,即用于基于点云的3D场景图生成的语义图Transformer(Semantic Graph TransFormer)。该任务旨在将基于点云的场景解析为语义结构图,其核心挑战在于建模复杂的全局结构。现有的基于图卷积网络(GCNs)的方法存在过平滑困境,且只能从有限的邻近节点传播信息。相比之下,SGFormer使用Transformer层作为基础构建块以实现全局信息传递,并包含两种为3D场景图生成任务量身设计的新层。具体而言,我们引入图嵌入层以最佳利用图边中的全局信息,同时保持可比的计算成本。此外,我们提出语义注入层,利用来自大规模语言模型(即ChatGPT)的语言学知识来增强物体的视觉特征。我们在已建立的3DSSG数据集上基准测试了我们的SGFormer,在关系预测的R@50上取得了40.94%的绝对提升,并在具有复杂场景的子集上比最先进水平高出88.36%。我们的分析进一步显示了SGFormer在长尾和零样本场景中的优越性。我们的源代码可在 https://github.com/Andy20178/SGFormer 获取。
引用
@article{arxiv.2303.11048,
title = {SGFormer: Semantic Graph Transformer for Point Cloud-based 3D Scene Graph Generation},
author = {Changsheng Lv and Mengshi Qi and Xia Li and Zhengyuan Yang and Huadong Ma},
journal= {arXiv preprint arXiv:2303.11048},
year = {2023}
}
备注
To be published in Thirty-Eighth AAAI Conference on Artificial Intelligence