中文

面向 NLP 应用的秩与运行时间感知压缩

计算与语言 2020-10-08 v1 机器学习 性能

摘要

基于序列模型的 NLP 应用可能非常庞大。然而,许多从中受益的应用运行在计算与存储能力极为有限的小型设备上,同时仍有运行时间约束。因此,需要一种压缩技术,能在不损害推理运行时间与任务精度的前提下实现显著压缩。本文提出一种称为混合矩阵分解(Hybrid Matrix Factorization, HMF)的新压缩技术,可实现这一双重目标。HMF 通过利用智能混合结构使矩阵秩翻倍,改进了低秩矩阵分解(LMF)技术,从而获得优于 LMF 的精度。此外,通过保留稠密矩阵,其推理运行时间快于剪枝或基于结构矩阵的压缩技术。我们在跨多个任务(翻译、意图检测、语言建模)的 5 个 NLP 基准上评估了该技术的效果,并表明在相近精度值与压缩比下,HMF 可实现比剪枝快 2.32 倍以上的推理运行时间,以及比 LMF 高 16.77% 的精度。

关键词

引用

@article{arxiv.2010.03193,
  title  = {Rank and run-time aware compression of NLP Applications},
  author = {Urmish Thakker and Jesse Beu and Dibakar Gope and Ganesh Dasika and Matthew Mattina},
  journal= {arXiv preprint arXiv:2010.03193},
  year   = {2020}
}

备注

Published at SustaiNLP@EMNLP 2020. arXiv admin note: text overlap with arXiv:1906.04886