一种面向智能眼镜的实用立体深度系统
计算机视觉与模式识别
2023-04-03 v2
摘要
我们展示了一种产品化的端到端立体深度感知系统的设计,该系统进行预处理、在线立体校正以及立体深度估计,并在校正不可靠时回退到单目深度估计。我们的深度感知系统的输出随后被用于一种新视角生成流水线,以利用智能眼镜捕获的第一人称视角图像创建 3D 计算摄影效果。所有这些步骤均在移动手机严苛的计算预算下于设备端执行,并且由于我们预期用户可使用广泛的智能手机,我们的设计需要具有通用性,不能依赖于特定硬件或 ML 加速器(如智能手机 GPU)。尽管上述每个步骤都已被充分研究,但对一个实用系统的描述仍然缺失。对于这样一个系统,所有这些步骤需要协同工作,并在系统内部故障或输入数据不够理想时优雅地回退。我们展示了如何稳健地处理由于发热等导致的校准意外变化,在真实场景中鲁棒地支持深度估计,并仍遵守流畅用户体验所需的内存与延迟约束。我们展示了我们训练的模型速度很快,在使用了六年的三星 Galaxy S8 手机 CPU 上运行时间少于 1 秒。我们的模型对未见过的数据泛化良好,并在 Middlebury 以及智能眼镜捕获的真实场景图像上取得了良好结果。
引用
@article{arxiv.2211.10551,
title = {A Practical Stereo Depth System for Smart Glasses},
author = {Jialiang Wang and Daniel Scharstein and Akash Bapat and Kevin Blackburn-Matzen and Matthew Yu and Jonathan Lehman and Suhib Alsisan and Yanghan Wang and Sam Tsai and Jan-Michael Frahm and Zijian He and Peter Vajda and Michael F. Cohen and Matt Uyttendaele},
journal= {arXiv preprint arXiv:2211.10551},
year = {2023}
}
备注
Accepted at CVPR2023