基于 CLIP 模型的细粒度文本与图像引导点云补全
计算机视觉与模式识别
2023-08-21 v1
摘要
本文关注近期流行的由多模态信息引导的点云补全任务。尽管现有方法通过融合辅助图像已取得了优异性能,但仍存在一些不足,包括模型泛化能力弱以及所提取特征的细粒度语义信息不足。在本工作中,我们提出了一种新颖的多模态融合网络用于点云补全,该网络能够同时融合视觉与文本信息,有效预测不完整形状的语义与几何特征。具体而言,为克服小规模数据集导致的先验信息缺乏,我们采用了在大量图文对上预训练的视觉-语言模型。因此,该大规模模型的文本与视觉编码器具有更强的泛化能力。接着,我们提出一种多阶段特征融合策略,将文本与视觉特征逐步融合到主干网络中。同时,为进一步探究细粒度文本描述对点云补全的有效性,我们还构建了一个带有细粒度描述的文本语料库,可为三维形状提供更丰富的几何细节。丰富的文本描述可用于训练和评估我们的网络。大量定量与定性实验证明了我们的方法相较于最先进的点云补全网络具有更优的性能。
引用
@article{arxiv.2308.08754,
title = {Fine-grained Text and Image Guided Point Cloud Completion with CLIP Model},
author = {Wei Song and Jun Zhou and Mingjie Wang and Hongchen Tan and Nannan Li and Xiuping Liu},
journal= {arXiv preprint arXiv:2308.08754},
year = {2023}
}