中文

大型语言模型在行业部署中经济可行性如何?

计算与语言 2026-04-22 v1

摘要

生成式AI由大型语言模型(LLM)驱动正在跨越医疗决策支持、金融分析、企业检索和对话自动化等领域在行业中部署。在此类场景中,可靠性、效率和成本控制至关重要。在这些设置中,模型必须满足严格的能源、延迟和硬件利用率约束——不仅仅是准确率。然而,先前的评估管道仍以准确率为中心,导致存在部署-评估鸿沟——在模型评估中缺乏操作和经济标准。为解决这一问题,我们提出EDGE-EVAL——一种面向行业的基准框架,对LLMs在其整个生命周期上进行评估,目标是针对legacy NVIDIA Tesla T4 GPU。对LLaMA和Qwen变体进行三个行业任务的基准测试,我们引入五个部署指标——经济盈亏平衡(Nbreak)、智能每瓦(IPW)、系统密度(\rho_sys)、冷启动税(Ctax)和量化保真度(Qret)——涵盖盈利性、能源效率、硬件扩展、无服务器可行性和压缩安全性。我们的结果揭示了一条明确的效率边界——<2B参数类的模型在经济和生态维度上占据优势,对 larger baselines。LLaMA-3.2-1B(INT4)在14个请求(中值)内实现ROI盈亏平衡,实现7B模型的3倍能源归一化智能,低于4位量化下的6,900 tokens/s/GB。我们进一步发现尽管QLoRA减少了内存占用,但对于小模型增加了最高达7倍的适应能源——这挑战了关于量化感知训练在边缘部署中的既有假设。

关键词

引用

@article{arxiv.2604.19342,
  title  = {Are Large Language Models Economically Viable for Industry Deployment?},
  author = {Abdullah Mohammad and Sushant Kumar Ray and Pushkar Arora and Rafiq Ali and Ebad Shabbir and Gautam Siddharth Kashyap and Jiechao Gao and Usman Naseem},
  journal= {arXiv preprint arXiv:2604.19342},
  year   = {2026}
}

备注

Accepted at ACL 2026 (Industry Track)