CompletionFormer:基于卷积与视觉Transformer的深度补全
计算机视觉与模式识别
2023-04-26 v1
摘要
给定稀疏深度及其对应的RGB图像,深度补全旨在将稀疏测量值在整个图像空间上传播,以获得稠密深度预测。尽管基于深度学习的深度补全方法取得了巨大进展,但卷积层或图模型的局部性使得网络难以建模像素间的长程关系。虽然近期全Transformer架构凭借全局感受野取得了令人鼓舞的结果,但由于其局部特征细节退化,与成熟的CNN模型之间仍存在性能与效率差距。本文提出联合卷积注意力与Transformer模块(JCAT),将卷积注意力层与Vision Transformer深度耦合为单一模块,作为基本单元以金字塔结构构建我们的深度补全模型。这种混合架构在单一模型中自然兼具卷积的局部连接性与Transformer的全局上下文。因此,我们的CompletionFormer在室外KITTI深度补全基准与室内NYUv2数据集上优于最先进的基于CNN的方法,且相比纯Transformer方法实现了显著更高的效率(近1/3的FLOPs)。代码见\url{https://github.com/youmi-zym/CompletionFormer}。
引用
@article{arxiv.2304.13030,
title = {CompletionFormer: Depth Completion with Convolutions and Vision Transformers},
author = {Zhang Youmin and Guo Xianda and Poggi Matteo and Zhu Zheng and Huang Guan and Mattoccia Stefano},
journal= {arXiv preprint arXiv:2304.13030},
year = {2023}
}
备注
Accepted by CVPR 2023. Code: https://github.com/youmi-zym/CompletionFormer. Project: https://youmi-zym.github.io/projects/CompletionFormer/