中文

MULLER:面向视觉的多层拉普拉斯缩放器

计算机视觉与模式识别 2023-04-07 v1

摘要

图像缩放操作是现代计算机视觉中基础的预处理模块。在深度学习变革中,研究者忽视了除常用的现成缩放器(如最近邻、双线性、双三次)之外其他替代缩放方法的潜力。我们关注的核心问题是:前端缩放器是否影响深度视觉模型的性能?本文提出一种极其轻量的多层拉普拉斯缩放器,仅含少量可训练参数,称为 MULLER 缩放器。MULLER 具有带通特性,它学习增强某些有益于下游识别模型的频率子带中的细节。我们表明 MULLER 可轻松插入各种训练流程,并以极少甚至零额外成本有效提升底层视觉任务性能。具体而言,我们选取最先进的视觉 Transformer MaxViT 作为基线,表明若使用 MULLER 训练,与标准训练方案相比,MaxViT 在 ImageNet-1k 上 top-1 准确率提升高达 0.6%,同时享受 36% 的推理成本节省以达到相近的 top-1 准确率。值得注意的是,MULLER 的性能还随模型规模和训练数据规模(如 ImageNet-21k 和 JFT)而扩展,且广泛适用于多个视觉任务,包括图像分类、目标检测与分割,以及图像质量评估。

关键词

引用

@article{arxiv.2304.02859,
  title  = {MULLER: Multilayer Laplacian Resizer for Vision},
  author = {Zhengzhong Tu and Peyman Milanfar and Hossein Talebi},
  journal= {arXiv preprint arXiv:2304.02859},
  year   = {2023}
}