中文

HW-GPT-Bench:面向语言模型的硬件感知架构基准

机器学习 2024-11-05 v3 人工智能

摘要

随着语言模型规模的不断增大,对其在多个维度上的深入分析已成为必要,以评估在关键硬件指标(如延迟、能耗、GPU内存使用和性能)之间的权衡。要在特定硬件约束下识别最优模型配置,已成为关键挑战,由于在多个设备上进行全穷举式训练和评估的计算负担巨大。为此,我们引入HW-GPT-Bench,一种硬件感知基准,利用代理预测近似估算13种设备上GPT-2系列架构的各种硬件指标,架构参数规模可达1.55B。我们的代理模型通过校准预测和可靠的不确定性估计,忠实地建模能耗和延迟测量中固有的异方差噪声。为估算困惑度,我们采用神经网络架构搜索(NAS)中的权重共享技术,继承自最大GPT-2模型的预训练权重。最后,我们通过在几秒钟内模拟各种多目标优化算法的优化轨迹,展示了HW-GPT-Bench的实用性。

关键词

引用

@article{arxiv.2405.10299,
  title  = {HW-GPT-Bench: Hardware-Aware Architecture Benchmark for Language Models},
  author = {Rhea Sanjay Sukthanker and Arber Zela and Benedikt Staffler and Aaron Klein and Lennart Purucker and Joerg K. H. Franke and Frank Hutter},
  journal= {arXiv preprint arXiv:2405.10299},
  year   = {2024}
}

备注

59 pages, 73 figures, 11 tables