中文

预训练图像处理 Transformer

计算机视觉与模式识别 2021-11-09 v4 机器学习

摘要

随着现代硬件算力的强劲增长,在大规模数据集上学习的预训练深度学习模型(如 BERT、GPT-3)已展现出相对于传统方法的有效性。这一重大进展主要归功于 transformer 及其变体架构的表征能力。本文研究底层计算机视觉任务(如去噪、超分辨率和去雨),并提出了一种名为图像处理 transformer(IPT)的新预训练模型。为最大程度挖掘 transformer 的能力,我们利用知名的 ImageNet 基准生成大量受损图像对。IPT 模型在这些图像上以多头多尾结构进行训练。此外,引入对比学习以良好适配不同的图像处理任务。该预训练模型在微调后可高效用于目标任务。仅使用一个预训练模型,IPT 就在多个底层基准上优于当前最先进(SOTA)方法。代码见 https://github.com/huawei-noah/Pretrained-IPT 与 https://gitee.com/mindspore/mindspore/tree/master/model_zoo/research/cv/IPT

关键词

引用

@article{arxiv.2012.00364,
  title  = {Pre-Trained Image Processing Transformer},
  author = {Hanting Chen and Yunhe Wang and Tianyu Guo and Chang Xu and Yiping Deng and Zhenhua Liu and Siwei Ma and Chunjing Xu and Chao Xu and Wen Gao},
  journal= {arXiv preprint arXiv:2012.00364},
  year   = {2021}
}

备注

CVPR 2021