面向低层视觉的高效基于Transformer的图像预训练
计算机视觉与模式识别
2022-03-22 v2
摘要
预训练已在高层计算机视觉中创下众多最先进成果,而鲜有研究探讨预训练在图像处理系统中的作用。本文量身定制了基于Transformer的预训练方案,以提升多种低层任务。为全面诊断预训练的影响,我们设计了一整套原则性评估工具,揭示其对内部表征的作用。观察表明,预训练在低层任务中扮演的角色截然不同。例如,在超分辨率(SR)中,预训练为高层引入更多局部信息,带来显著性能提升;而在去噪中,预训练几乎不影响内部特征表征,导致增益有限。进一步,我们探索了不同的预训练方法,发现多相关任务预训练比其他替代方案更有效且数据高效。最后,我们将研究扩展至不同数据规模与模型大小,并比较了Transformer与基于CNN的架构。基于该研究,我们成功为多个低层任务开发了最先进模型。代码发布于 https://github.com/fenglinglwb/EDT。
引用
@article{arxiv.2112.10175,
title = {On Efficient Transformer-Based Image Pre-training for Low-Level Vision},
author = {Wenbo Li and Xin Lu and Shengju Qian and Jiangbo Lu and Xiangyu Zhang and Jiaya Jia},
journal= {arXiv preprint arXiv:2112.10175},
year = {2022}
}