SLM-Bench:面向环境影响的小型语言模型综合基准测试——扩展版
计算与语言
2025-09-05 v2 计算机与社会
性能
摘要
小型语言模型(SLMs)具备计算效率和可及性优势,但仍缺乏其性能与环境影响的系统评估。我们引入SLM-Bench,首个专为评估SLMs在多个维度上进行综合评估的基准测试,包括准确性、计算效率和可持续性指标。SLM-Bench在9个NLP任务上评估15个SLMs,涵盖23个数据集,跨越14个领域;在4种硬件配置上进行评估,实现对其有效性进行严格比较。与先前基准不同,SLM-Bench量化了 correctness、computation 和 consumption 三个维度下的11个指标,实现对效率权衡的整体评估。我们的评估考虑了受控硬件条件,确保跨模型进行公平比较。我们开发了一个开源基准测试管道,采用标准化评估协议以促进可重复性和进一步研究。我们的发现突显了SLMs之间的多样化权衡,其中一些模型在准确性方面表现突出,而另一些模型在能源效率方面取得优势。SLM-Bench制定了新的SLM评估标准,弥合了资源效率与实际应用之间的鸿沟。
引用
@article{arxiv.2508.15478,
title = {SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts--Extended Version},
author = {Nghiem Thanh Pham and Tung Kieu and Duc-Manh Nguyen and Son Ha Xuan and Nghia Duong-Trung and Danh Le-Phuoc},
journal= {arXiv preprint arXiv:2508.15478},
year = {2025}
}
备注
24 pages. An extended version of "SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts" accepted at EMNLP 2025