中文

迈向资源高效的 LLM:蒸馏流水线的端到端能耗核算

机器学习 2026-05-15 v1 人工智能

摘要

大语言模型部署的增加推动了对 GPU 的需求和数据中心规模的激增,引发了人们对电力使用、电网压力以及现代 AI 工作负载影响的担忧。知识蒸馏常被推崇为获取更廉价、更高效模型的最有效途径之一,然而这些主张很少考虑完整的端到端能耗与资源成本,包括教师模型侧的关键工作负载,如数据生成、logit 缓存和评估。我们提出了一个全面的能耗核算框架,通过详细分阶段跟踪 GPU 设备功耗来测量蒸馏流水线的完整计算成本。在我们的实验中,我们分离并记录了不同阶段的经验能耗,并系统测量了两种常见蒸馏方法的能耗与排放:经典的基于 logit 的知识蒸馏和合成数据监督微调,构建了能耗-质量帕累托前沿,揭示了此前被忽略的成本。基于这些测量与分析,我们推导出了在能耗和预算约束下选择蒸馏方法与超参数的实用设计规则,并发布了一个开源的测量工具与核算协议,为可比较、可复现的蒸馏研究提供了一个标准化基础,明确核算完整的流水线能耗影响。

关键词

引用

@article{arxiv.2605.13981,
  title  = {Towards Resource-Efficient LLMs: End-to-End Energy Accounting of Distillation Pipelines},
  author = {Katherine Lambert and Sasha Luccioni},
  journal= {arXiv preprint arXiv:2605.13981},
  year   = {2026}
}

备注

Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 11 pages, 6 figures