中文

FLoRA:用于参数高效微调和降低LLM推理时延的融合前向-后向适配器

机器学习 2025-11-04 v1 人工智能

摘要

随着大语言模型(LLM)规模不断增长,高效训练和微调从未像今天一样重要。这导致了对参数高效微调(PEFT)的广泛关注,以及诸如低秩适配器(LoRA)等有效方法的涌现。尽管近年来对各种PEFT方法进行了广泛研究,但其中的大部分课题仍未得到充分探索,受限于巨大的自由度。在本文中,我们提出FLoRA,这是一种融合前向-后向适配器(FFBA)的家族,用于LLM的下游任务的参数高效微调。FFBA将流行的LoRA和并行适配器的思想相结合,以提高整体微调准确性。同时,通过融合前向和后向适配器到基本模型的投影层中,最小化了延迟。实验结果表明,所提出的FFBA适配器在类似参数预算下,相较于广泛使用的LoRA,在准确性和延迟方面均表现出显著优势。

关键词

引用

@article{arxiv.2511.00050,
  title  = {FLoRA: Fused forward-backward adapters for parameter efficient fine-tuning and reducing inference-time latencies of LLMs},
  author = {Dhananjaya Gowda and Seoha Song and Junhyun Lee and Harshith Goka},
  journal= {arXiv preprint arXiv:2511.00050},
  year   = {2025}
}