MobileDepth:移动设备上的高效单目深度预测
计算机视觉与模式识别
2020-11-23 v1 机器学习
图像与视频处理
摘要
深度预测在计算机视觉与机器人系统的许多有用应用中是基础性的。在手机上,增强现实、自动对焦等部分有用应用的性能可通过准确的深度预测得到提升。本工作提出了一种用于深度预测的高效全卷积网络架构,其使用 RegNetY 06 作为编码器、split-concatenate shuffle 模块作为解码器。同时,提供了数据增强、超参数与损失函数的恰当组合,以高效训练该轻量网络。此外,开发了一款 Android 应用,可加载 CNN 模型,通过移动摄像头捕获的单目图像预测深度图,并评估模型的平均延迟与每秒帧数。结果表明,该网络在 NYU Depth v2 数据集上取得了 82.7% 的 δ1 精度,同时在 ARM A76 CPU 上仅有 62ms 延迟,从而能够实时预测来自移动摄像头的深度图。
引用
@article{arxiv.2011.10189,
title = {MobileDepth: Efficient Monocular Depth Prediction on Mobile Devices},
author = {Yekai Wang},
journal= {arXiv preprint arXiv:2011.10189},
year = {2020}
}