中文

结合运行时引擎与执行提供程序的代码小型语言模型服务资源利用洞察

软件工程 2025-08-01 v2 人工智能 机器学习

摘要

语言模型的快速增长,特别是在代码生成领域,需要大量的计算资源,引发了对能源消耗和环境影响的担忧。优化语言模型推理的资源利用至关重要,而小型语言模型(SLMs)为减少资源需求提供了一种有前景的解决方案。我们的目标是从在代码生成 SLMs 背景下进行推理的软件工程师的角度,分析深度学习服务配置(定义为运行时引擎和执行提供程序的组合)对资源利用的影响,包括能源消耗、执行时间和计算资源利用率。我们使用十二个代码生成 SLMs 进行了面向技术的多阶段实验流程,以调查各种配置下的能源消耗、执行时间和计算资源利用率。不同配置之间出现了显著差异。CUDA 执行提供程序配置在能源消耗和执行时间方面均优于 CPU 执行提供程序配置。在所有配置中,TORCH 与 CUDA 配合表现出最高的能效,与其他服务配置相比实现了 37.99% 至 89.16% 的节能。类似地,像 ONNX 这样的优化运行时引擎与 CPU 执行提供程序配合,在基于 CPU 的配置中实现了 8.98% 至 72.04% 的节能。此外,TORCH 与 CUDA 配合展现了高效的计算资源利用率。服务配置的选择显著影响资源利用。尽管仍需进一步研究,我们推荐上述最适合软件工程师提升服务资源利用效率需求的配置。

关键词

引用

@article{arxiv.2412.15441,
  title  = {Insights into resource utilization of code small language models serving with runtime engines and execution providers},
  author = {Francisco Durán and Matias Martinez and Patricia Lago and Silverio Martínez-Fernández},
  journal= {arXiv preprint arXiv:2412.15441},
  year   = {2025}
}

备注

Accepted in Journal of Systems and Software (JSS). For its published version refer to the Journal of JSS