中文

通过权重调制实现全能图像处理 Transformer:Instruct-IPT

计算机视觉与模式识别 2024-12-17 v2

摘要

由于低层视觉模型体积昂贵且计算成本高,旨在同时解决少数低层视觉任务的全能模型因此备受欢迎。然而,现有的全能模型在任务范围和性能方面存在局限。为克服这些限制,我们提出了 Instruct-IPT——一种能够有效解决大范围图像恢复任务的全能图像处理 Transformer(IPT),如去噪、去模糊、去雨、去雾和去雪。虽然大多数研究提出特征适应方法,但我们发现其在处理高度不同任务方面无效,建议采用权重调制来适应特定任务。首先,我们搜索任务敏感的权重并在其上引入任务特定的偏置。其次,我们对偏置进行秩分析以制定良好的压缩策略并进行低秩分解。最后,我们提出同步训练,该方法同时更新任务通用背板模型和任务特定偏置。如此一来,模型便被指示学习通用知识和任务特定知识。通过这种简单而有效的方法,Instruct-IPT 能够以低成本更好地协调具有不同特征的任务。作为额外功能,我们使 Instruct-IPT 能够接收人类提示。我们 conducted experiments on Instruct-IPT 以展示该方法在多个任务上的有效性,并将该方法有效扩展到扩散去噪器。代码可在 https://github.com/huawei-noah/Pretrained-IPT 查阅。

关键词

引用

@article{arxiv.2407.00676,
  title  = {Instruct-IPT: All-in-One Image Processing Transformer via Weight Modulation},
  author = {Yuchuan Tian and Jianhong Han and Hanting Chen and Yuanyuan Xi and Ning Ding and Jie Hu and Chao Xu and Yunhe Wang},
  journal= {arXiv preprint arXiv:2407.00676},
  year   = {2024}
}

备注

14 pages, 5 figures