中文

端到端超掩码剪枝:学习剪枝图像描述模型

计算机视觉与模式识别 2021-10-08 v1 计算与语言 机器学习

摘要

随着深度模型的发展,过去十年中图像描述研究在原始性能上取得了显著增益,同时模型复杂度和计算成本不断增加。然而令人惊讶的是,针对图像描述任务深度网络压缩的工作几乎未受关注。在图像描述研究中,我们首次对三种不同流行图像描述架构(即 Soft-Attention、Up-Down 和 Object Relation Transformer)上的多种非结构化权重剪枝方法进行了广泛比较。此后,我们提出一种新颖的端到端权重剪枝方法,其基于权重对训练损失的敏感性执行渐进稀疏化。剪枝方案随后扩展至编码器剪枝,我们表明在编码器剪枝之前同时进行解码器剪枝与训练可带来良好的整体性能。经验上,我们展示 80% 至 95% 稀疏的网络(模型尺寸至多缩减 75%)可以匹敌或超越其稠密对应模型。能够在 MS-COCO 数据集上取得 >120 的 CIDEr 分数、但模型尺寸仅分别为 8.7 MB 和 14.5 MB(相较稠密版本分别缩减 96% 和 94%)的 Up-Down 和 Object Relation Transformer 的代码与预训练模型已公开于 https://github.com/jiahuei/sparse-image-captioning。

关键词

引用

@article{arxiv.2110.03298,
  title  = {End-to-End Supermask Pruning: Learning to Prune Image Captioning Models},
  author = {Jia Huei Tan and Chee Seng Chan and Joon Huang Chuah},
  journal= {arXiv preprint arXiv:2110.03298},
  year   = {2021}
}

备注

Pattern Recognition; In Press