AttentionLite:面向视觉的高效自注意力模型
计算机视觉与模式识别
2021-01-14 v1 机器学习
摘要
我们提出一种新颖框架,用于生成一类称为AttentionLite的参数与计算高效模型,适用于资源受限应用。已有工作主要经由知识蒸馏或剪枝来优化模型。除融合这两种机制外,我们的联合优化框架还利用近期自注意力替代卷积的进展。我们可在单次训练过程中同时从计算繁重的教师模型蒸馏知识并剪枝学生模型,从而大幅降低训练与微调时间。我们在CIFAR-10、CIFAR-100和Tiny-ImageNet数据集上评估所提方法的优势。我们的AttentionLite模型不仅在准确率上显著优于未优化对应模型,且发现某些情况下仅消耗极少参数与FLOPs便几乎达到计算繁重教师模型的性能。具体而言,相比其教师模型,AttentionLite模型可实现高达30倍参数效率与2倍计算效率且无显著准确率下降。
引用
@article{arxiv.2101.05216,
title = {AttentionLite: Towards Efficient Self-Attention Models for Vision},
author = {Souvik Kundu and Sairam Sundaresan},
journal= {arXiv preprint arXiv:2101.05216},
year = {2021}
}
备注
5 pages, 3 figures, 2 tables