中文

基于物理视觉中图像复原生成式方法的反思:来自信息视角的理论分析

计算机视觉与模式识别 2022-12-09 v2 图像与视频处理

摘要

与基于手工组合模型的传统解构方法相比,端到端生成式方法被认为是基于物理的视觉中图像复原更具前景的解决方案。然而,现有生成式方法在定量性能上仍有很大改进空间。更关键的是,这些方法由于可解释性弱而被视为黑箱,且鲜有理论试图解释其机制与学习过程。在本研究中,我们尝试利用信息论重新解释这些用于图像复原任务的生成式方法。与常规理解不同,我们分析了这些方法的信息流,并识别出在生成复原结果时分别被提取和优化的三类信息来源(提取的高层信息、保留的低层信息,以及源输入中缺失的外部信息)。我们通过扩展信息瓶颈原理,进一步推导了它们的学习行为、优化目标及相应的信息边界。基于该理论框架,我们发现许多现有生成式方法往往是对为常规生成任务设计的通用模型的直接套用,可能存在过度抽象的提取过程、固有细节丢失,以及训练中的梯度消失或失衡等问题。我们分别以直观与理论解释分析了这些问题,并以经验证据加以证明。最终,我们提出了解决上述问题的通用方案或思路,并在三个不同图像复原任务的六个数据集上以性能提升验证了这些方法。

关键词

引用

@article{arxiv.2212.02198,
  title  = {Rethinking Generative Methods for Image Restoration in Physics-based Vision: A Theoretical Analysis from the Perspective of Information},
  author = {Xudong Kang and Haoran Xie and Man-Leung Wong and Jing Qin},
  journal= {arXiv preprint arXiv:2212.02198},
  year   = {2022}
}