中文

BINO:基于编码器的自监督立体视觉,支持原生双对输入

计算机视觉与模式识别 2026-03-31 v1

摘要

立体视觉需要保留细粒度跨视图对应关系的特征,而不仅仅是语义相似性。最近的自监督视觉模型虽迁移良好,但并非为此目标设计,几何导向方法往往依赖双目解码器或其他显式关联模块进行预训练。BINO 探索是否可以在紧凑编码器内部学习强大的双目结构。其方法是在输入阶段融合校正后的配对图像,形成立体微单元 token,并采用行感知的 patch 相位位置编码。训练使用单视图掩码 token 蒸馏,辅以遮挡和视角特定的外观不匹配。在资源极其有限的场景下仅使用 KITTI 对象进行预训练,BINO 在无联结探针条件下,在代理密集立体、硬性负检索和 KITTI Stereo~2012 差异等任务上均优于所有比较基线。采用与每个编码器相同的轻量级立体头部后,它在 KITTI Stereo~2015 上的迁移实验延续了相同的定性趋势。这些结果表明,许多常被分配给独立联结模块的跨视图推理,实际上可以被学习进紧凑且可复用的编码器内部。

关键词

引用

@article{arxiv.2603.27904,
  title  = {BINO: Encoder Centric Self Supervised Stereo With Native Pair Input},
  author = {Haokun Zhou},
  journal= {arXiv preprint arXiv:2603.27904},
  year   = {2026}
}