中文

论弹性语言模型

信息检索 2023-11-14 v1 机器学习

摘要

大规模预训练语言模型在广泛的语言理解与信息检索任务中取得了引人注目的性能。知识蒸馏提供了将大语言模型压缩为小模型的机会,以达到合理的延迟-性能权衡。然而,对于请求数量(如提交至搜索引擎的查询)高度变化的场景,压缩语言模型所达成的静态权衡可能并不总是合适。一旦模型被赋予静态权衡,当请求量大时延迟过高,或请求量小时性能过低,便会显得不足。为此,我们提出一种弹性语言模型(ElasticLM),根据请求流弹性调整权衡。基本思想是向压缩语言模型引入计算弹性,使权衡可随可扩展且可控的计算实时变化。具体而言,我们施加弹性结构使 ElasticLM 具备计算弹性,并设计弹性优化以在计算弹性下学习 ElasticLM。为服务 ElasticLM,我们应用弹性调度。考虑信息检索的特殊性,我们将 ElasticLM 适配于稠密检索与重排序,分别提出 ElasticDenser 与 ElasticRanker。离线评估在语言理解基准 GLUE 及包括 Natural Question、Trivia QA 和 MS MARCO 在内的若干信息检索任务上进行。结果表明,ElasticLM 及 ElasticDenser 和 ElasticRanker 相比一系列静态基线表现正确且具有竞争力。此外,还进行了带并发的在线模拟。结果证明 ElasticLM 可针对变化的请求流提供弹性权衡。

关键词

引用

@article{arxiv.2311.07204,
  title  = {On Elastic Language Models},
  author = {Chen Zhang and Benyou Wang and Dawei Song},
  journal= {arXiv preprint arXiv:2311.07204},
  year   = {2023}
}

备注

27 pages, 11 figures, 9 tables