Activated LoRA:用于内在功能的微调 LLMs
机器学习
2025-10-06 v5 人工智能
摘要
低秩适应(LoRA)已成为微调大型基础模型权重的高效框架,并已成为 LLMs 数据驱动定制的首选方法。尽管具有高度定制行为和能力的潜力,但在多轮对话设置中切换相关 LoRA 效率低下,因为在生成开始前,必须使用 LoRA 权重重新计算整个轮次历史的键值(KV)缓存。为了解决这个问题,我们提出了 Activated LoRA(aLoRA),这是一种适配器架构,它修改了 LoRA 框架,使其仅对调用 aLoRA 之后的序列中的 token 进行权重适应。这一改变至关重要地使 aLoRA 能够接受输入字符串的基础模型 KV 缓存,这意味着 aLORA 可以在链中需要时立即激活,而无需重新计算先前的键和值。这使我们能够构建所谓的内在功能,即在输入链或对话的某些部分执行明确定义操作的专用模型,而在其他部分默认使用基础模型。我们训练了一组基于 aLoRA 的内在功能模型,证明了其准确性与标准 LoRA 相当,同时显著提高了推理效率。我们已将 Activated LoRA 实现贡献给 Huggingface PEFT 库 https://github.com/huggingface/peft。
引用
@article{arxiv.2504.12397,
title = {Activated LoRA: Fine-tuned LLMs for Intrinsics},
author = {Kristjan Greenewald and Luis Lastras and Thomas Parnell and Vraj Shah and Lucian Popa and Giulio Zizzo and Chulaka Gunasekara and Ambrish Rawat and David Cox},
journal= {arXiv preprint arXiv:2504.12397},
year = {2025}
}