LoRETTA:用于大语言模型超低参数微调的低秩经济张量列车适配
计算与语言
2024-02-20 v1 人工智能
机器学习
摘要
各种参数高效微调(PEFT)技术已被提出,旨在在保持模型性能的同时实现计算高效的微调。然而,随着大语言模型(LLMs)的快速部署,现有的 PEFT 方法仍然受到可训练参数数量增长的局限。为了解决这一挑战,我们提出了 LoRETTA,这是一个超参数高效框架,通过张量列车分解显著减少可训练参数。具体而言,我们提出了两种方法,分别命名为 {LoRETTA} 和 {LoRETTA}。前者采用张量化适配器,为大语言模型的微调提供了一种高性能且轻量级的方法。后者强调通过一组小张量因子进行权重参数化的微调。在 LLaMA-2-7B 模型上,LoRETTA 以多达 更少的参数实现了与大多数广泛使用的 PEFT 方法相当或更好的性能。此外,实证结果表明,所提方法有效提高了训练效率,具有更好的多任务学习性能,并增强了抗过拟合能力。基于 Huggingface 框架和 PEFT 库构建的即插即用代码将会发布。
引用
@article{arxiv.2402.11417,
title = {LoRETTA: Low-Rank Economic Tensor-Train Adaptation for Ultra-Low-Parameter Fine-Tuning of Large Language Models},
author = {Yifan Yang and Jiajun Zhou and Ngai Wong and Zheng Zhang},
journal= {arXiv preprint arXiv:2402.11417},
year = {2024}
}