中文

刻画长上下文NLP模型的效率与精度权衡

计算与语言 2022-04-18 v1 机器学习

摘要

随着许多自然语言处理(NLP)的真实世界应用由长文本组成,出现了测量能处理更长输入序列模型精度的NLP基准。然而,这些基准未考虑当输入规模或模型规模变化时,精度、速度与功耗之间的权衡。在本工作中,我们对两种广泛使用的长序列模型——Longformer-Encoder-Decoder (LED) 与 Big Bird——在SCROLLS基准的四个数据集上微调与推理时的这一精度-效率权衡进行了系统研究。为研究该权衡如何随超参数设置变化,我们在固定资源预算下比较了四种序列长度(1024、2048、3072、4096)与两种模型规模(base与large)下的模型。我们发现LED始终以比Big Bird更低的能量成本取得更好精度。对于摘要任务,我们发现为获得更高精度,增大模型规模比增大序列长度更具能量效率。然而,这是以推理速度大幅下降为代价的。对于问答任务,我们发现由于固定资源预算下可能的更大训练批量,较小模型既更高效又更精确。

关键词

引用

@article{arxiv.2204.07288,
  title  = {Characterizing the Efficiency vs. Accuracy Trade-off for Long-Context NLP Models},
  author = {Phyllis Ang and Bhuwan Dhingra and Lisa Wu Wills},
  journal= {arXiv preprint arXiv:2204.07288},
  year   = {2022}
}

备注

Accepted at NLP Power! Workshop on Efficient Benchmarking in NLP at ACL2022