面向图像合成与图像识别的空间自适应压缩激励网络学习
计算机视觉与模式识别
2022-10-04 v3 机器学习
摘要
在图像合成与图像识别中构建轻量且具表达力的深度网络仍是一个具有挑战性的问题。受近期观察——即数据特异性使得 Transformer 模型中的多头自注意力(MHSA)如此强大——的启发,本文提出将广泛采用的轻量压缩激励(SE)模块扩展为空间自适应以强化其数据特异性,作为 MHSA 的卷积替代方案,同时保留 SE 的效率与卷积的归纳偏置。文中给出了分别用于图像合成与图像识别的两种空间自适应压缩激励(SASE)模块设计。对于图像合成任务,所提 SASE 在少样本与单样本学习任务中进行了测试,表现优于已有方法。对于图像识别任务,所提 SASE 用作 ResNets 中卷积层的直接替换,在 ImageNet-1000 数据集上取得了远优于原始 ResNets、且略优于 Swin-Transformer 与 Pyramid-Transformer 等 MHSA 对应模型的精度,且模型规模显著更小。
引用
@article{arxiv.2112.14804,
title = {Learning Spatially-Adaptive Squeeze-Excitation Networks for Image Synthesis and Image Recognition},
author = {Jianghao Shen and Tianfu Wu},
journal= {arXiv preprint arXiv:2112.14804},
year = {2022}
}