中文

TinyLLM:面向边缘计算机的语言模型训练与部署框架

机器学习 2024-12-23 v1 分布式、并行与集群计算 新兴技术 网络与互联网体系结构

摘要

语言模型因其通用性而受到广泛关注,这些能力似乎随模型参数规模的增大而逐渐显现。然而,这些大型模型对计算系统提出了严苛要求,推理过程需要显著的内存和计算资源,这使得在移动和边缘设备上执行推理具有挑战性,往往需要通过网络调用远程托管的模型。远程推理随后引入延迟、不可靠网络连接以及隐私 concerns 等问题。为此,我们探讨是否可以偏离模型规模不断增大的趋势。我们假设,much smaller models (~30-120M 参数) 通过精心筛选用于预训练和微调的数据,能够在特定任务中超越其更大规模的模型。我们在部署面向感知应用的边缘设备模型的背景下进行此 investigation。我们进行一项系统性研究,训练了多个基础模型,发现小型模型可在边缘设备上本地运行,实现高吞吐量和高准确率。基于这些发现,我们开发了一个框架,允许用户针对其特定应用训练定制的基础模型并在边缘部署。

关键词

引用

@article{arxiv.2412.15304,
  title  = {TinyLLM: A Framework for Training and Deploying Language Models at the Edge Computers},
  author = {Savitha Viswanadh Kandala and Pramuka Medaranga and Ambuj Varshney},
  journal= {arXiv preprint arXiv:2412.15304},
  year   = {2024}
}