中文

PanMatch:释放大视觉模型用于统一匹配模型的潜能

计算机视觉与模式识别 2025-07-14 v1 人工智能 多媒体

摘要

本工作提出 PanMatch,一种 versatile 的 robust correspondence matching 基础模型。不同于以往依赖 task-specific 架构和 domain-specific 微调以支持立体匹配、光流或特征匹配等任务的方法,我们的关键洞察是,任何两帧的 correspondence matching 任务都可以在 2D 位移估计框架内使用相同模型权重解决。这种表述消除了为设计专用 unified architecture 或 task-specific ensemble 模型的必要。它通过为位移估计算法赋予前所未有的 generalization 能力来实现 multi-task 集成。为此,我们强调适用于多种 domain 和 task 的 robust feature extractor 的重要性,提出利用 Large Vision Models 中的 all-purpose features 的 feature transformation pipeline,为 matching baseline 赋予 zero-shot cross-view matching 能力。此外,我们汇集了来自立体匹配、光流和特征匹配 domain 近 180 万样本的 cross-domain 数据集进行预训练。我们在广泛的 domain 和 downstream task 上使用相同模型权重展示了 PanMatch 的 versatility。我们的模型在 cross-task 评估中超越 UniMatch 和 Flow-Anything,在 task-oriented benchmark 上表现出与大多数 SOTA task-specific algorithm 相当的性能。此外,PanMatch 在异常场景下的 zero-shot 性能前所未有,例如雨天和卫星影像,其中大多数现有 robust algorithm 无法获得有意义结果。

关键词

引用

@article{arxiv.2507.08400,
  title  = {PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models},
  author = {Yongjian Zhang and Longguang Wang and Kunhong Li and Ye Zhang and Yun Wang and Liang Lin and Yulan Guo},
  journal= {arXiv preprint arXiv:2507.08400},
  year   = {2025}
}