在立体匹配中发挥视觉基础模型的优势
计算机视觉与模式识别
2024-04-10 v1 人工智能
机器人学
摘要
立体匹配已成为智能车辆三维环境感知的关键技术。长期以来,卷积神经网络(CNN)一直是该领域特征提取的主流选择。尽管如此,越来越多的共识认为,现有范式应向视觉基础模型(VFM)演进,特别是那些基于视觉 Transformer(ViT)构建并通过在大规模无标签数据集上进行自监督预训练的模型。虽然 VFM 擅长提取信息丰富且通用的视觉特征,但具体到密集预测任务,其在几何视觉任务中的性能往往欠佳。本研究首次探索了将 VFM 适配于立体匹配的可行方法。我们的 ViT 适配器称为 ViTAS,由三类模块构建:空间差异化、patch 注意力融合和交叉注意力。第一个模块初始化特征金字塔,而后两个模块分别将立体信息和多尺度上下文信息聚合为细粒度特征。ViTAStereo 将 ViTAS 与基于代价体积的立体匹配后端处理相结合,在 KITTI Stereo 2012 数据集上取得第一名,在 3 像素容差下,其误差像素百分比比次优网络 StereoBase 低约 7.9%。在多种场景下的进一步实验表明,与所有其他 SOTA 方法相比,其具有更出色的泛化能力。我们相信这一新范式将为下一代立体匹配网络铺平道路。
引用
@article{arxiv.2404.06261,
title = {Playing to Vision Foundation Model's Strengths in Stereo Matching},
author = {Chuang-Wei Liu and Qijun Chen and Rui Fan},
journal= {arXiv preprint arXiv:2404.06261},
year = {2024}
}