中文

增强 Transformer 与大型语言模型资源效率的优化策略

机器学习 2025-02-04 v1 计算与语言

摘要

自然语言处理领域的诸多进步高度依赖 Transformer 架构,但随着模型规模不断扩大,其带来的资源成本也日益沉重。本研究探讨了包括量化、知识蒸馏和剪枝在内的优化技术,侧重于在保持性能的前提下提升能源和计算效率。就单一方法而言,4 位量化显著降低能源消耗且几乎无精度损失。而融合方法,如 NVIDIA 的 Minitron 方法结合知识蒸馏和结构化剪枝,进一步展示了在规模减小和精度保持之间取得有前景的权衡。本文引入一种新型优化方程,提供一种灵活的框架用于比较各种方法。通过对这些压缩方法的深入研究,我们为开发更可持续和高效的大型语言模型提供了有价值的见解,为人们照亮了往往被忽视的能源效率问题。

关键词

引用

@article{arxiv.2502.00046,
  title  = {Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models},
  author = {Tom Wallace and Naser Ezzati-Jivan and Beatrice Ombuki-Berman},
  journal= {arXiv preprint arXiv:2502.00046},
  year   = {2025}
}

备注

Accepted for ACM's ICPE 2025 in Short Paper format