DMTNet:基于Transformer的双像素图像散焦去模糊动态多尺度网络
计算机视觉与模式识别
2022-09-19 v1
摘要
近期的工作利用卷积神经网络(CNN)基于双像素数据在散焦去模糊任务中取得了优异的结果,而数据的稀缺限制了视觉Transformer在该任务中的探索和尝试。此外,现有工作使用固定参数和网络架构对具有不同分布和内容信息的图像进行去模糊,这也影响了模型的泛化能力。在本文中,我们提出了一种名为DMTNet的动态多尺度网络,用于双像素图像散焦去模糊。DMTNet主要包含两个模块:特征提取模块和重建模块。特征提取模块由若干视觉Transformer块组成,利用其强大的特征提取能力获取更丰富的特征并提升模型的鲁棒性。重建模块由若干动态多尺度子重建模块(DMSSRM)组成。DMSSRM能够根据输入图像的模糊分布和内容信息,通过自适应地为不同尺度的特征分配权重来重建图像。DMTNet结合了Transformer与CNN的优势,其中视觉Transformer提升了CNN的性能上限,而CNN的归纳偏置使Transformer无需依赖大量数据即可提取更鲁棒的特征。DMTNet可能是使用视觉Transformer将模糊图像恢复清晰的首次尝试。通过与CNN结合,视觉Transformer有望在小数据集上取得更好的性能。在流行基准上的实验结果表明,我们的DMTNet显著优于当前最先进的方法。
引用
@article{arxiv.2209.06040,
title = {DMTNet: Dynamic Multi-scale Network for Dual-pixel Images Defocus Deblurring with Transformer},
author = {Dafeng Zhang and Xiaobing Wang},
journal= {arXiv preprint arXiv:2209.06040},
year = {2022}
}