中文

GRPO 指导的 LoRA 稀疏策略:跨语言迁移中的适配器稀疏性政策

计算与语言 2026-01-13 v1

摘要

参数高效微调是一种在计算或数据受限时适应大语言模型(LLM)以新语言的做法,但适配器管道通常通过网格搜索选择全局剪枝比率。这种做法计算成本高昂且高度依赖开发集,因为它需要重复训练、固定稀疏性,并错失局部最优解。我们引入 GRASP LoRA(GRPO Guided Adapter Sparsity Policy),将全局稀疏度视为可学习的控制变量。GRPO 控制器在训练期间交替运行,定期在小型微型开发集上探测候选剪枝比率,并从奖励信号中在线更新单个全局剪枝比率。它 operates on merged source and target LoRA adapters on a frozen backbone,并用一个控制器运行来学习剪枝比率,随后进行一次最终合并和剪枝微调运行,固定剪枝比率。在将英语跨语言迁移到阿拉伯语和中文的场景中,包括 XL-Sum 总结和 MLQA 提取式问答,使用 Llama 3 8B 的 GRASP LoRA 在语义忠实性、内容覆盖和答案质量方面优于强大的目标 Only 和合并剪枝基线。它将端到端运行时间缩短了多个数量级,降低了对大型开发集的依赖,使适配器在低资源部署中具有实际可行性。

关键词

引用

@article{arxiv.2601.06702,
  title  = {GRASP LoRA: GRPO Guided Adapter Sparsity Policy for Cross Lingual Transfer},
  author = {Besher Hassan and Xiuying Chen},
  journal= {arXiv preprint arXiv:2601.06702},
  year   = {2026}
}

备注

12 pages, 3 figures