中文

学习一种高效的多模态深度补全模型

计算机视觉与模式识别 2022-08-24 v1

摘要

随着稀疏 ToF 传感器在移动设备中的广泛应用,RGB 图像引导的稀疏深度补全近来受到广泛关注,但仍面临一些问题。首先,多模态信息的融合需要更多网络模块来处理不同模态,而稀疏 ToF 测量的应用场景通常要求轻量结构与小计算开销。其次,将稀疏且含噪的深度数据与密集逐像素 RGB 数据融合可能引入伪影。本文提出一种轻量但高效的深度补全网络,由双分支全局与局部深度预测模块及漏斗形卷积空间传播网络组成。双分支结构以轻量骨干网提取并融合跨模态特征。改进的空间传播模块可逐步细化补全深度图。此外,针对深度补全问题提出了修正梯度损失。实验结果表明,所提方法能以轻量架构优于部分最先进方法。所提方法亦在 MIPI2022 RGB+TOF 深度补全挑战赛中夺得冠军。

关键词

引用

@article{arxiv.2208.10771,
  title  = {Learning an Efficient Multimodal Depth Completion Model},
  author = {Dewang Hou and Yuanyuan Du and Kai Zhao and Yang Zhao},
  journal= {arXiv preprint arXiv:2208.10771},
  year   = {2022}
}

备注

To appear in ECCV 2022 workshop and codes are available at https://github.com/dwHou/EMDC-PyTorch