中文

MARCO:引导语义对应关系的无界空间导航

计算机视觉与模式识别 2026-04-21 v1

摘要

近期语义对应关系的进展依赖于双编码器架构,将 DINOv2 与扩散模型结合。虽然准确,但这些具有数十亿参数的模型在训练关键点之外的泛化能力较差,显示出基准性能与实际可用性之间的差距,其中查询点很少匹配训练期间看到的点。基于 DINOv2,我们引入 MARCO,一个由新颖训练框架驱动的统一通用对应模型,增强了细粒度局部化和语义泛化。通过将粗到细目标与自蒸馈框架耦合,后者将稀疏监督扩展到注释区域之外,我们的方法将少量关键点转化为密集且语义连贯的对应关系。MARCO 在 SPair-71k、AP-10K 和 PF-PASCAL 上取得了新的最佳纪录,提升幅度在细粒度局部化阈值处放大(+8.9 [email protected]),对未见关键点的强大泛化提升(+5.1,SPair-U)和类别提升(+4.7,MP-100),同时比基于扩散的方法小 3 倍且快 10 倍。代码可在 https://github.com/visinf/MARCO 查看。

关键词

引用

@article{arxiv.2604.18267,
  title  = {MARCO: Navigating the Unseen Space of Semantic Correspondence},
  author = {Claudia Cuttano and Gabriele Trivigno and Carlo Masone and Stefan Roth},
  journal= {arXiv preprint arXiv:2604.18267},
  year   = {2026}
}

备注

CVPR 2026 Oral. Project page: https://visinf.github.io/MARCO/