通过特征化低秩混合诱导跨语言和任务的泛化
计算与语言
2024-08-02 v2 人工智能
摘要
将预训练的大语言模型(LLM)适应数十或数百种人类语言的各种下游任务在计算上代价高昂。参数高效微调(PEFT)通过仅调整少量参数显著降低了适应成本。然而,常见的PEFT方法LoRA(Hu等人,2022)由于激进的参数绑定和不同数据集之间的负干扰,在多样化数据集混合上表现次优。在这项工作中,我们提出了特征化低秩混合(FLix),一种新颖的PEFT方法,专为有效的多任务多语言适应而设计。FLix将每个独特的数据集特征(例如数据集的语言或任务)与其自己的低秩权重更新参数相关联。通过为每个数据集组合特征特定参数,FLix可以适应多样化的数据集混合,并更好地泛化到未见过的数据集。我们的实验表明,FLix在监督学习和零样本设置的多种任务上带来了显著改进,在零样本语义解析中获得了高达14.2个精确匹配点的增益。
引用
@article{arxiv.2402.17934,
title = {Inducing Generalization across Languages and Tasks using Featurized Low-Rank Mixtures},
author = {Chu-Cheng Lin and Xinyi Wang and Jonathan H. Clark and Han Lu and Yun Zhu and Chenxi Whitehouse and Hongkun Yu},
journal= {arXiv preprint arXiv:2402.17934},
year = {2024}
}
备注
Revised version