中文

AirLLM: 基于扩散策略的自适应 LoRA,用于无线远程微调大语言模型

机器学习 2025-07-16 v1 人工智能 计算与语言

摘要

在边缘设备上运行大型语言模型 (LLM) 正日益受到通信带限和计算内存成本紧张的挑战。因此,云协助远程微调变得必不可少。然而,现有的低秩适应 (LoRA) 方法通常采用固定或启发式秩配置,随后通过所有 LoRA 参数进行过-the-air 传输可能相当低效。为解决此限制,我们开发了 AirLLM,一个用于通信感知 LoRA 适应的分层扩散策略框架。具体而言,AirLLM 将秩配置建模为一个涵盖所有 LoRA 插入投影的结构化动作向量。为解决 underlying 的高维序列决策问题,一个近似策略优化 (PPO) 代理通过联合观察无线状态和语言复杂度生成粗粒度决策,然后通过去噪扩散隐式模型 (DDIM) 细化,以产生高分辨率、面向任务和信道的自适应秩向量。两个模块交替优化,DDIM 在分类器自由引导 (CFG) 范例下训练,以保持与 PPO 奖励的对齐。在不同信噪比下的实验表明,AirLLM 在显著降低传输成本的同时,持续增强微调性能,凸显了基于强化驱动、扩散细化秩适应在可扩展且高效的无线远程微调中的有效性。

关键词

引用

@article{arxiv.2507.11515,
  title  = {AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air},
  author = {Shiyi Yang and Xiaoxue Yu and Rongpeng Li and Jianhang Zhu and Zhifeng Zhao and Honggang Zhang},
  journal= {arXiv preprint arXiv:2507.11515},
  year   = {2025}
}

备注

11 pages, 8 figures