中文

UFM:基于多模态图像助手的统一特征匹配预训练模型

计算机视觉与模式识别 2025-03-31 v1 图像与视频处理

摘要

图像特征匹配是计算机视觉中的基础任务,仍面临多模态图像应用的挑战,常需针对特定数据集进行复杂训练。本文引入一种统一特征匹配预训练模型(UFM),旨在解决跨多种模态图像的特征匹配问题。我们提出了多模态图像助手(MIA)变换器,具有精细可调结构,能够处理多样化的特征匹配问题。UFM在解决同一模态内的特征匹配任务以及跨不同模态的特征匹配任务方面都表现出色。此外,我们提出了一种数据增强算法和阶段性预训练策略,以有效应对稀疏数据中的特定模态问题以及不平衡模态数据集所带来的挑战。实验结果表明,UFM在各种特征匹配任务中表现出卓越的泛化能力和性能。代码将在:https://github.com/LiaoYun0x0/UFM发布。

关键词

引用

@article{arxiv.2503.21820,
  title  = {UFM: Unified Feature Matching Pre-training with Multi-Modal Image Assistants},
  author = {Yide Di and Yun Liao and Hao Zhou and Kaijun Zhu and Qing Duan and Junhui Liu and Mingyu Lu},
  journal= {arXiv preprint arXiv:2503.21820},
  year   = {2025}
}

备注

34 pages, 13 figures