{S\textsuperscript{2}M\textsuperscript{2}}:可靠深度估计的可扩展立体匹配模型
计算机视觉与模式识别
2025-10-14 v4 人工智能
机器人学
摘要
追求一种在不同分辨率和视差范围内无需数据集特定微调即可获得良好性能的通用立体匹配模型,揭示了根本性的权衡。迭代式局部搜索方法在受限基准测试上取得高分数,但其核心机制本质上限制了对真正泛化所必需的全局一致性。然而,全局匹配架构虽然在理论上更健壮,但由于计算和内存成本的昂贵,历史上一直难以实现。我们以 {S\textsuperscript{2}M\textsuperscript{2}} 解决了这一困境,这是一个不依赖成本体积过滤或深度细化堆栈即可实现卓越准确性和高效率的全局匹配架构。我们的设计集成了用于稳健远程对应关系的多分辨率变换器,采用一种集中概率于可行匹配的新颖损失函数进行训练。该方法实现了更稳健的视差、遮挡和置信度的联合估计。{S\textsuperscript{2}M\textsuperscript{2}} 在 Middlebury v3 和 ETH3D 基准测试上建立了新的最佳水平,显著优于先前方法在大多数指标上,同时以具竞争力的效率重建高质量细节。
引用
@article{arxiv.2507.13229,
title = {{S\textsuperscript{2}M\textsuperscript{2}}: Scalable Stereo Matching Model for Reliable Depth Estimation},
author = {Junhong Min and Youngpil Jeon and Jimin Kim and Minyong Choi},
journal= {arXiv preprint arXiv:2507.13229},
year = {2025}
}
备注
8 pages, 5 figures, ICCV accepted paper