中文

基于粗到细语言引导的通用 3D 形状匹配

计算机视觉与模式识别 2026-03-10 v3

摘要

在计算机视觉和图形学中,在形状之间建立稠密对应关系是关键任务,而先前的方法依赖于近等距假设和同质的主体类型(即仅针对人类形状工作)。然而,为跨类别对象构建语义对应关系仍然具有挑战性,目前受到相对有限的关注。为实现这一目标,我们提出了 UniMatch,一个语义感知、粗到细的框架,用于在不限制对象类别的情况下构建稠密语义对应关系。关键洞察是将“粗”语义线索提升到“细”对应关系,这通过两个阶段实现。在“粗”阶段,我们对 3D 形状进行类别无关的分割以获得非重叠的语义部件,并提示多模态大语言模型 (MLLM) 来识别部件名称。然后,我们使用预训练的视觉语言模型 (VLM) 提取文本嵌入,实现匹配语义部件的构建。在“细”阶段,我们利用这些粗糙对应关系通过专门的基于秩的对比方案来指导稠密对应关系的学习。由于类别无关的分割、语言引导和基于秩的对比学习,您的方法对通用对象类别非常灵活,无需预定义的部件提案,使其能够实现跨类别和非等距形状的通用匹配。广泛的实验表明,UniMatch 在各种具有挑战性的情景中 consistently outperform 竞争方法。

关键词

引用

@article{arxiv.2602.19112,
  title  = {Universal 3D Shape Matching via Coarse-to-Fine Language Guidance},
  author = {Qinfeng Xiao and Guofeng Mei and Bo Yang and Liying Zhang and Jian Zhang and Kit-lun Yick},
  journal= {arXiv preprint arXiv:2602.19112},
  year   = {2026}
}

备注

Accepted by CVPR 2026