基于状态空间模型的多视图立体 MVSMamba
计算机视觉与模式识别
2025-11-04 v1
摘要
可靠的特征表示对于学习型多视图立体 (MVS)至关重要,这取决于准确的特征匹配。最近的 MVS 方法利用 Transformer 捕获基于常规特征金字塔网络提取的局部特征的长程依赖性。然而,基于 Transformer 的 MVS 方法的二次复杂度给在性能和效率之间寻求平衡带来了挑战。受全球建模能力和线性复杂度的 Mamba 架构启发,我们提出了 MVSMamba,即首个基于 Mamba 的 MVS 网络。MVSMamba 能够以最小的计算开销实现高效的全局特征聚合。为了充分发挥 Mamba 在 MVS 中的潜能,我们提出了基于 novel reference-centered dynamic scanning strategy 的 Dynamic Mamba 模块 (DM 模块),使其能够:(1)从参考视图到源视图实现高效的 intra- 和 inter-view 特征互动,(2)实现全向多视图特征表示,(3)实现多尺度全局特征聚合。大量实验结果表明,MVSMamba 在 DTU 数据集和 Tanks-and-Temples 基准上优于最先进的 MVS 方法,同时在性能和效率上都表现出色。源代码可在 https://github.com/JianfeiJ/MVSMamba 获取。
引用
@article{arxiv.2511.01315,
title = {MVSMamba: Multi-View Stereo with State Space Model},
author = {Jianfei Jiang and Qiankun Liu and Hongyuan Liu and Haochen Yu and Liyong Wang and Jiansheng Chen and Huimin Ma},
journal= {arXiv preprint arXiv:2511.01315},
year = {2025}
}
备注
Accepted by NeurIPS 2025