面向网络边缘的低延迟协作式基础模型微调资源管理
信息论
2024-07-16 v1 人工智能
math.IT
摘要
大规模基础模型(FoMo)涌现,其能够执行类人智能的能力激发了其在网络边缘部署的需求,以便设备能够访问前沿人工智能技术。为提升用户体验,预训练的FoMo需要通过微调技术适配特定的下游任务。为突破单设备的内存和计算限制,我们倡导在面向设备-边缘协作式微调(DEFT)范式下,边缘设备协作在FoMo中同时优化不同微调参数的不同部分。然而,参数块位于FoMo架构的不同深度,导致由于基于梯度反向传播的计算,引发不同的计算延迟和内存成本。异构的本地计算和内存容量以及信道条件 necessitate 一种集成的通信与计算资源分配,以实现低延迟(LoLa)DEFT。为此,我们考虑深度分布式DEFT块分配问题。通过利用块深度与计算延迟和内存成本呈单调递增关系的特性,提出了低复杂度的切割-计数-检查(CRUNCH)算法来解决最优块-设备匹配问题。接下来,联合带宽和块分配问题更为复杂。我们观察到,通过对原问题的变换和分析,可以得到可分割的拉格朗日表达式,其中引入表示设备参与情况的变量。然后,采用对偶升力方法进行迭代求解。通过在GLUE基准测试上的大量实验,我们的结果表明,LoLa DEFT在微调RoBERTa模型时可实现显著的延迟降低。
引用
@article{arxiv.2407.09873,
title = {Resource Management for Low-latency Cooperative Fine-tuning of Foundation Models at the Network Edge},
author = {Hai Wu and Xu Chen and Kaibin Huang},
journal= {arXiv preprint arXiv:2407.09873},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication