面向点云三维稠密描述的上下文建模
计算机视觉与模式识别
2022-10-11 v1
摘要
三维稠密描述作为一项新兴的视觉-语言任务,旨在从一组点云中识别并定位每个对象,并生成独特的自然语言句子来描述每个被定位的对象。然而,现有方法主要聚焦于挖掘对象间关系,而忽略了上下文信息,尤其是点云中的非对象细节与背景环境,从而导致低质量的描述,例如不准确的相对位置信息。本文首次尝试利用点云聚类特征作为上下文信息,以补充点云的非对象细节与背景环境,并将其引入三维稠密描述任务。我们提出两个独立模块,即全局上下文建模(GCM)与局部上下文建模(LCM),以由粗到精的方式对点云进行上下文建模。具体而言,GCM 模块借助全局上下文信息捕获所有对象间的对象间关系,以获得整个点云更完整的场景信息。LCM 模块利用目标对象的邻近对象及局部上下文信息的影响来丰富对象表示。借助此类全局与局部上下文建模策略,我们所提模型能有效刻画对象表示与上下文信息,从而生成对被定位对象全面且详细的描述。在 ScanRefer 与 Nr3D 数据集上的大量实验表明,我们的方法在三维稠密描述任务上创下新高,并验证了我们所提点云上下文建模的有效性。
引用
@article{arxiv.2210.03925,
title = {Contextual Modeling for 3D Dense Captioning on Point Clouds},
author = {Yufeng Zhong and Long Xu and Jiebo Luo and Lin Ma},
journal= {arXiv preprint arXiv:2210.03925},
year = {2022}
}