中文

一种面向智能眼镜的实用立体深度系统

计算机视觉与模式识别 2023-04-03 v2

摘要

我们展示了一种产品化的端到端立体深度感知系统的设计,该系统进行预处理、在线立体校正以及立体深度估计,并在校正不可靠时回退到单目深度估计。我们的深度感知系统的输出随后被用于一种新视角生成流水线,以利用智能眼镜捕获的第一人称视角图像创建 3D 计算摄影效果。所有这些步骤均在移动手机严苛的计算预算下于设备端执行,并且由于我们预期用户可使用广泛的智能手机,我们的设计需要具有通用性,不能依赖于特定硬件或 ML 加速器(如智能手机 GPU)。尽管上述每个步骤都已被充分研究,但对一个实用系统的描述仍然缺失。对于这样一个系统,所有这些步骤需要协同工作,并在系统内部故障或输入数据不够理想时优雅地回退。我们展示了如何稳健地处理由于发热等导致的校准意外变化,在真实场景中鲁棒地支持深度估计,并仍遵守流畅用户体验所需的内存与延迟约束。我们展示了我们训练的模型速度很快,在使用了六年的三星 Galaxy S8 手机 CPU 上运行时间少于 1 秒。我们的模型对未见过的数据泛化良好,并在 Middlebury 以及智能眼镜捕获的真实场景图像上取得了良好结果。

关键词

引用

@article{arxiv.2211.10551,
  title  = {A Practical Stereo Depth System for Smart Glasses},
  author = {Jialiang Wang and Daniel Scharstein and Akash Bapat and Kevin Blackburn-Matzen and Matthew Yu and Jonathan Lehman and Suhib Alsisan and Yanghan Wang and Sam Tsai and Jan-Michael Frahm and Zijian He and Peter Vajda and Michael F. Cohen and Matt Uyttendaele},
  journal= {arXiv preprint arXiv:2211.10551},
  year   = {2023}
}

备注

Accepted at CVPR2023