中文

将掩码自编码器作为损失函数用于图像与视频复原

计算机视觉与模式识别 2023-03-30 v1

摘要

随着深度学习的出现,图像与视频复原取得了显著飞跃。深度学习范式的成功在于三个关键要素:数据、模型和损失。目前,许多工作致力于前两者,而极少有研究关注损失函数。带着“诸如 L1L_1L2L_2 和感知损失等事实上的优化函数是否最优?”这一问题,我们探索了损失的潜力,并提出我们的观点:“学习的损失函数增强了神经网络在图像与视频复原中的学习能力”。具体而言,我们立足于掩码自编码器(MAE)的肩膀上,并将其表述为一种“学习的损失函数”,这是因为预训练的 MAE 天然继承了图像推理的先验。我们从三个角度考察了我们观点的有效性:1)从任务定制的 MAE 到原生 MAE,2)从图像任务到视频任务,3)从 transformer 结构到卷积神经网络结构。在多个图像与视频任务(包括图像去噪、图像超分辨率、图像增强、引导图像超分辨率、视频去噪和视频增强)上的大量实验表明,学习的损失函数带来了持续的性能提升。此外,学习的损失函数具有优势,因为它可以在训练时直接插入现有网络,而不涉及推理阶段的计算。代码将公开可用。

关键词

引用

@article{arxiv.2303.16411,
  title  = {Unlocking Masked Autoencoders as Loss Function for Image and Video Restoration},
  author = {Man Zhou and Naishan Zheng and Jie Huang and Chunle Guo and Chongyi Li},
  journal= {arXiv preprint arXiv:2303.16411},
  year   = {2023}
}