All-in-One:将视觉基础模型导入立体匹配
计算机视觉与模式识别
2024-12-16 v1
摘要
作为基础视觉任务,立体匹配取得了显著进展。尽管最近的迭代优化方法取得了令人瞩目的性能,但其特征提取能力仍有提升空间。灵感来自视觉基础模型(VFM)提取通用表征的能力,本 work 提出 AIO-Stereo 可灵活选择和从 multiple heterogeneous VFMs 传输知识到单个立体匹配模型。为更好地在 heterogeneous VFMs 与立体匹配模型之间对齐特征并充分利用 VFMs 的先验知识,我们提出了双层特征利用机制,对齐 heterogeneous 特征并传递多层知识。基于该机制,设计了双层选择性知识传输模块,以选择性地传输知识并整合 multiple VFMs 的优势。实验结果表明,AIO-Stereo 在多个数据集上实现了 start-of-the-art performance,并在 Middlebury 数据集上排名第 1,超过了所有已发布的 work 在 ETH3D benchmark 上。
引用
@article{arxiv.2412.09912,
title = {All-in-One: Transferring Vision Foundation Models into Stereo Matching},
author = {Jingyi Zhou and Haoyu Zhang and Jiakang Yuan and Peng Ye and Tao Chen and Hao Jiang and Meiya Chen and Yangyang Zhang},
journal= {arXiv preprint arXiv:2412.09912},
year = {2024}
}
备注
Accepted by AAAI 2025