为弱监督三维视觉定位蒸馏由粗到细的语义匹配知识
计算机视觉与模式识别
2023-07-19 v1
摘要
三维视觉定位旨在三维场景中寻找与给定语句查询对应的目标物体。尽管已有许多方法被提出并取得了令人印象深刻的性能,但它们都需要三维点云中密集的物体-语句配对标注,这既耗时又昂贵。为解决细粒度标注数据难以获取的问题,我们提出利用弱监督标注来学习三维视觉定位模型,即仅使用粗粒度场景-语句对应关系来学习物体-语句关联。为此,我们设计了一种新颖的语义匹配模型,以由粗到细的方式分析物体候选框与语句之间的语义相似度。具体而言,我们首先提取物体候选框,并基于特征与类别相似度矩阵粗选前K个候选。接着,我们逐一使用每个候选重构语句中被掩码的关键词,重构准确率精细地反映了各候选与查询的语义相似度。此外,我们将由粗到细的语义匹配知识蒸馏到典型的两阶段三维视觉定位模型中,通过充分利用已有架构的成熟结构降低了推理成本并提升了性能。我们在ScanRefer、Nr3D和Sr3D上进行了大量实验,证明了所提方法的有效性。
引用
@article{arxiv.2307.09267,
title = {Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding},
author = {Zehan Wang and Haifeng Huang and Yang Zhao and Linjun Li and Xize Cheng and Yichen Zhu and Aoxiong Yin and Zhou Zhao},
journal= {arXiv preprint arXiv:2307.09267},
year = {2023}
}
备注
ICCV2023