中文

基于数据包络分析的自然语言模型资源-性能权衡评估

计算与语言 2022-11-04 v1 最优化与控制

摘要

自然语言模型通常通过一组高维描述性指标来概括,包括训练语料库规模、训练时间、可训练参数数量、推理时间以及评估跨任务性能的统计量。这些指标的高维特性给客观比较模型带来了挑战;特别是难以评估模型在性能与资源(计算时间、内存等)之间所做的权衡。我们将数据包络分析(DEA)应用于评估资源-性能权衡的这一问题中。DEA是一种非参数方法,用于衡量消耗一种或多种输入并产生至少一种输出的抽象单元的生产效率。我们将自然语言模型重新表述为适用于DEA的单元,并表明DEA可用于创建一个量化模型性能与效率的有效框架。DEA的一个核心特征是它识别出位于性能有效前沿上的模型子集。DEA也具有可扩展性,已应用于具有数千个单元的问题。我们报告了将DEA应用于14种具有不同架构的语言模型的实证结果,并表明DEA可用于识别有效平衡资源需求与性能的模型子集。

关键词

引用

@article{arxiv.2211.01486,
  title  = {Assessing Resource-Performance Trade-off of Natural Language Models using Data Envelopment Analysis},
  author = {Zachary Zhou and Alisha Zachariah and Devin Conathan and Jeffery Kline},
  journal= {arXiv preprint arXiv:2211.01486},
  year   = {2022}
}

备注

9 pages, 1 figure, Eval4NLP workshop