用于语义场景理解的语言辅助三维特征学习
计算机视觉与模式识别
2022-12-13 v2
摘要
学习具有描述性的三维特征对于理解具有多样物体和复杂结构的三维场景至关重要。然而,在端到端训练的三维场景理解网络中,重要的几何属性和场景上下文是否得到足够重视通常未知。为引导三维特征学习关注重要的几何属性和场景上下文,我们探索了文本场景描述的帮助。给定一些与三维场景配对的自由形式描述,我们提取关于物体关系和物体属性的知识。然后我们通过三个基于分类的辅助任务将该知识注入到三维特征学习中。这种语言辅助训练可与现代物体检测和实例分割方法结合,以促进三维语义场景理解,尤其在标签匮乏的情况下。此外,经语言辅助学习的三维特征与语言特征对齐更好,这有助于各种三维-语言多模态任务。在多个三维仅任务和三维-语言任务的基准上的实验证明了我们语言辅助三维特征学习的有效性。代码可在 https://github.com/Asterisci/Language-Assisted-3D 获取。
引用
@article{arxiv.2211.14091,
title = {Language-Assisted 3D Feature Learning for Semantic Scene Understanding},
author = {Junbo Zhang and Guofan Fan and Guanghan Wang and Zhengyuan Su and Kaisheng Ma and Li Yi},
journal= {arXiv preprint arXiv:2211.14091},
year = {2022}
}
备注
Accepted by AAAI 2023