基于视觉语言梯度下降的全能深度展开网络
计算机视觉与模式识别
2025-03-24 v1
摘要
动态图像退化,包括噪声、模糊和光照不一致等,构成了图像修复的重大挑战,往往源于传感器限制或恶劣环境条件。现有的深度展开网络(DUN)提供稳定的修复性能,但需要针对每种退化类型手动选择退化矩阵,限制了其在多样化场景中的适应性。为此,本文提出视觉语言引导的展开网络(VLU-Net),一个统一的DUN框架,用于处理多种退化类型。VLU-Net利用在退化图像-文本对上精炼的视觉语言模型(VLM)将图像特征与退化描述对齐,从而选择目标退化的合适变换。通过将自动VLM基于梯度估计策略集成到准梯度下降(PGD)算法中,VLU-Net能够在保持可解释性的同时有效处理复杂的多退化修复任务。此外,我们设计了分层特征展开结构以增强VLU-Net框架,高效地合成各种层次的退化模式。VLU-Net是首个全能DUN框架,在SOTS去雾数据集上比当前领先的单一退化和全能端到端方法提高了3.74 dB,在Rain100L雨天数据集上提高了1.70 dB。
引用
@article{arxiv.2503.16930,
title = {Vision-Language Gradient Descent-driven All-in-One Deep Unfolding Networks},
author = {Haijin Zeng and Xiangming Wang and Yongyong Chen and Jingyong Su and Jie Liu},
journal= {arXiv preprint arXiv:2503.16930},
year = {2025}
}
备注
CVPR 2025