LLM 管道成本效益基准工具 CEBench
性能
2025-09-23 v2 机器学习
摘要
在线大语言模型 (LLM) 服务如 ChatGPT 和 Claude 3 已通过轻松实现新机会变革了商业运营和学术研究。然而,由于数据共享限制,医疗和金融等部门倾向于使用昂贵硬件资源部署本地 LLM 应用程序。这一情境需要在 LLM 的有效性优势和显著财务负担之间取得平衡。此外,模型的快速演化增加了基准测试的频率和冗余度。现有基准工具通常侧重于有效性,往往忽视经济考虑,使其发现在实际情境中不够适用。为解决这些挑战,我们引入 CEBench,一个专为多目标基准设计的开源工具包,关注 LLM 部署所必需的支出与有效性之间的关键权衡。CEBench 通过配置文件实现轻松修改,使利益相关者能够有效评估和优化这些权衡。该战略能力支持关键决策过程,以最大化有效性同时最小化成本影响。通过简化评估过程并强调成本效益,CEBench 旨在促进跨各行业和研究领域经济可行的 AI 解决方案的开发。代码和演示可在 https://github.com/amademicnoboday12/CEBench 查看。
引用
@article{arxiv.2407.12797,
title = {CEBench: A Benchmarking Toolkit for the Cost-Effectiveness of LLM Pipelines},
author = {Wenbo Sun and Jiaqi Wang and Qiming Guo and Ziyu Li and Wenlu Wang and Rihan Hai},
journal= {arXiv preprint arXiv:2407.12797},
year = {2025}
}