中文

控制视觉-语言模型用于多任务图像复原

计算机视觉与模式识别 2024-02-29 v2

摘要

CLIP 等视觉-语言模型已在零样本或无标签预测的多种下游任务中展现出巨大影响。然而,当涉及图像复原等底层视觉任务时,由于输入受损,其性能急剧下降。本文提出一种退化感知视觉-语言模型(DA-CLIP),以更好地将预训练视觉-语言模型迁移至底层视觉任务,作为图像复原的多任务框架。更具体地,DA-CLIP 训练一个额外的控制器,使固定的 CLIP 图像编码器适应于预测高质量特征嵌入。通过将嵌入经交叉注意力整合进图像复原网络,我们能够引导模型学习高保真图像重建。控制器本身还会输出一个与输入真实退化相匹配的退化特征,从而天然地成为不同退化类型的分类器。此外,我们构建了一个带合成文本描述的混合退化数据集用于 DA-CLIP 训练。我们的方法在“特定退化”和“统一”图像复原任务上均推进了最先进(SOTA)性能,展示了利用大规模预训练视觉-语言模型提示图像复原的有前景方向。我们的代码见 https://github.com/Algolzw/daclip-uir。

关键词

引用

@article{arxiv.2310.01018,
  title  = {Controlling Vision-Language Models for Multi-Task Image Restoration},
  author = {Ziwei Luo and Fredrik K. Gustafsson and Zheng Zhao and Jens Sjölund and Thomas B. Schön},
  journal= {arXiv preprint arXiv:2310.01018},
  year   = {2024}
}

备注

Accepted by ICLR 2024. Project page: https://algolzw.github.io/daclip-uir/index.html