中文

LiteDepth:探究移动设备上的快速准确深度估计

计算机视觉与模式识别 2022-09-05 v1

摘要

单目深度估计是计算机视觉领域的一项基本任务。尽管大量成功的方法已取得优异结果,但它们大多计算代价高昂,不适用于实时端侧推理。本文旨在解决更具实用性的单目深度估计应用,其方案不仅应考虑精度,还应考虑在移动设备上的推理时间。为此,我们首先开发了一个端到端基于学习的模型,其权重极小(1.4MB)、推理时间短(在 Raspberry Pi 4 上 27FPS)。然后,我们提出一种简单而有效的数据增强策略,称为 R2 crop,以提升模型性能。此外,我们观察到仅用单一损失项训练的简单轻量模型会遇到性能瓶颈。为缓解此问题,我们采用多个损失项在训练阶段提供充分约束。进一步地,通过简单的动态重加权策略,我们避免了耗时的损失项超参数选择。最后,我们采用结构感知蒸馏以进一步提升模型性能。值得注意的是,我们的方案 LiteDepth 在 MAI&AIM2022 单目深度估计挑战赛中排名第二,si-RMSE 为 0.311,RMSE 为 3.79,且在 Raspberry Pi 4 上测试的推理时间为 37msms。值得注意的是,我们提供了该挑战赛中最快的方案。代码与模型将发布于 \url{https://github.com/zhyever/LiteDepth}。

关键词

引用

@article{arxiv.2209.00961,
  title  = {LiteDepth: Digging into Fast and Accurate Depth Estimation on Mobile Devices},
  author = {Zhenyu Li and Zehui Chen and Jialei Xu and Xianming Liu and Junjun Jiang},
  journal= {arXiv preprint arXiv:2209.00961},
  year   = {2022}
}

备注

Accepted to European Conference on Computer Vision Workshop (ECCVW 2022)