中文

DiffLoRA:用于大语言模型的差分低秩适配器

计算与语言 2025-08-01 v1

摘要

最近提出了差分 Transformer 以通过去噪注意力机制消除 Transformer 模型中的噪声,从而提高性能。在本工作中,我们引入 DiffLoRA,这是一种对差分注意力机制的参数高效适配方法,正向和负向注意力项上都采用低秩适配器。该方法保留了 LoRA 的效率,同时致力于从差分注意力的性能提升中获益。我们在广泛的 NLP 任务上评估了 DiffLoRA,包括通用基准测试、多shot 零样本学习、RAG 和长上下文测试。我们观察到,尽管 DiffLoRA 在大多数评估任务中不及其他参数高效微调方法,但在某些领域显示出有趣的效果(例如在 HumanEval 上比 LoRA 提升 11 分)。我们分析了微调后的注意力模式,以识别这种行为的原因。

关键词

引用

@article{arxiv.2507.23588,
  title  = {DiffLoRA: Differential Low-Rank Adapters for Large Language Models},
  author = {Alexandre Misrahi and Nadezhda Chirkova and Maxime Louis and Vassilina Nikoulina},
  journal= {arXiv preprint arXiv:2507.23588},
  year   = {2025}
}