文本提示引导的图像复原
计算机视觉与模式识别
2023-12-12 v1
摘要
图像复原一直是计算机视觉学术与工业领域的前沿课题。由于退化信号通常是随机且多样的,近年来能够进行盲图像复原的“一体化”模型备受关注。早期工作需要为每种退化训练专门的头部和尾部模块,操作繁琐。近期工作侧重于从数据分布中学习视觉提示以识别退化类型。然而,大多数模型使用的提示是非文本的,未能充分强调人机协同的重要性。本文提出了一种有效的文本提示引导图像复原模型。在该模型中,针对任务微调的 BERT 用于准确理解用户指令并生成文本提示引导。设计了深度多头转置注意力与门控卷积模块,以弥合文本提示与视觉特征之间的鸿沟。该模型创新性地将语义提示引入低级视觉领域,突显了为图像复原任务提供一种自然、精确且可控方式的潜力。在公开去噪、去雾和去雨数据集上进行了大量实验。实验结果表明,与流行的最先进方法相比,该模型能获得更优越的性能,在不增加模型复杂度的前提下实现退化的准确识别与去除。相关源代码与数据将在 GitHub 网站 https://github.com/MoTong-AI-studio/TextPromptIR 上公开。
引用
@article{arxiv.2312.06162,
title = {Textual Prompt Guided Image Restoration},
author = {Qiuhai Yan and Aiwen Jiang and Kang Chen and Long Peng and Qiaosi Yi and Chunjie Zhang},
journal= {arXiv preprint arXiv:2312.06162},
year = {2023}
}
备注
12 pages, 10figures