中文

小型 BERT 网络的高效学习:LoRA 与 DoRA

机器学习 2025-08-26 v1

摘要

虽然大型语言模型 (LLMs) 已彻底改变了人工智能领域,但对 LLMs 进行微调的计算成本极高,阻碍了小型企业和拥有有限 GPU 资源的研究团队参与新研究。Hu 等人和 Liu 等人分别引入了低秩适应 (LoRA) 和权重分解低秩适应 (DoRA) 作为解决 LLM 微调计算挑战的高效且性能卓越的方案,展示了针对 GPT-3 和 RoBERTa 等模型实现了显著的加速和内存节省。我们寻求在原 LoRA 和 DoRA 论文的基础上进行扩展,通过对小型语言模型 minBERT 的案例研究来评估 LoRA 和 DoRA 的效率和性能。我们的发现表明,LoRA 和 DoRA 的最佳自定义配置结合自动混合精度 (AMP),在不损失性能的前提下显著提升了训练效率。此外,尽管 minBERT 的参数规模显著小于 GPT-3,我们的结果验证了即使在小模型空间中,语言模型的梯度更新也具有内在的低秩特性,观察到秩 1 分解可产生可忽略的性能损失。此外,凭借我们高效的 minBERT 实现,我们研究了众多模型架构、自定义损失函数和超参数,最终训练出一个最优的集成多任务 minBERT 模型,能够同时执行情感分析、语义重述检测和相似度评分。

关键词

引用

@article{arxiv.2508.17586,
  title  = {Exploring Efficient Learning of Small BERT Networks with LoRA and DoRA},
  author = {Daniel Frees and Aditri Bhagirath and Moritz Bolling},
  journal= {arXiv preprint arXiv:2508.17586},
  year   = {2025}
}