基于 VGGT 先验的稠密语义匹配
计算机视觉与模式识别
2025-09-26 v1
摘要
语义匹配旨在建立同一类别实例之间像素级的对应关系,是计算机视觉中的一项基本任务。现有方法存在两个局限性:(i) 几何歧义:其依赖 2D 基础模型特征(如 Stable Diffusion、DINO)常常难以消除对称结构的歧义,需额外微调且缺乏泛化性;(ii) 最近邻规则:其像素级匹配忽略跨图像的不可见性,忽略流形保持。这促使我们寻求几何感知的像素描述子和整体稠密对应机制。灵感来自最近在 3D 几何基础模型方面的进展,我们转向 VGGT,它提供几何导向的特征和与这些需求高度匹配的整体稠密匹配能力。然而,直接迁移 VGGT 具有挑战,因为其最初设计用于单实例内部跨视图的几何匹配,与跨实例语义匹配不符,且由于稀缺的稠密语义标注数据而受限。为解决此问题,我们提出一种方法:(i) 通过复用早期特征阶段、微调后期阶段并添加用于双向对应关系的语义头,保留 VGGT 的内在优势;(ii) 在数据稀缺情境下通过循环一致训练策略、合成数据增强和带抗混叠伪影的渐进训练配方来适应 VGGT 以适应语义匹配场景。广泛实验表明,我们的方法在几何感知、匹配可靠性和流形保持方面均优于先前基线。
引用
@article{arxiv.2509.21263,
title = {Dense Semantic Matching with VGGT Prior},
author = {Songlin Yang and Tianyi Wei and Yushi Lan and Zeqi Xiao and Anyi Rao and Xingang Pan},
journal= {arXiv preprint arXiv:2509.21263},
year = {2025}
}