$D^2LoRA$:面向低资源任务的数据驱动 LoRA 初始化
计算与语言
2025-03-25 v1
摘要
针对不同应用场景,尤其是在数据有限的情境下,对大型语言模型进行调优对于优化其性能至关重要。数据有限的情境下,对大型语言模型进行调优至关重要,特别是由于 LoRA 方法的收敛速度低于完整微调。在本文中,我们对包括监督微调 (SFT)、直接偏好优化 (DPO) 和 Odds Ratio 偏好优化 (ORPO) 在内的事后训练方法进行了分析,阐述其在使用 LoRA 方法进行任务特定学习的语境中的应用。随后我们引入 ,一种用于初始化 LoRA 指标的数据驱动方法,可提升训练效率,尤其在数据有限的情境下。我们的实验将 与 vanilla LoRA 进行性能和在极端数据受限条件下的灾难性遗忘比较。结果表明, 在 GSM8K 基准测试中取得 1% 的改进,在标题生成任务中在 ROUGE 分数上提升 2 分。 能够在任务特定数据稀缺时将 LLM 适应到多个任务,从而降低训练费用并节省数据成本。
引用
@article{arxiv.2503.18089,
title = {$D^2LoRA$: Data-Driven LoRA Initialization for Low Resource Tasks},
author = {Javad SeraJ and Mohammad Mahdi Mohajeri and Mohammad Javad Dousti},
journal= {arXiv preprint arXiv:2503.18089},
year = {2025}
}