中文

标签监督的 LLaMA 微调

计算与语言 2023-10-03 v1

摘要

大语言模型(LLMs)近期的成功在学术界与工业界均获得了显著关注。人们已做出大量努力,通过微调来增强开源 LLM 的零样本与少样本泛化能力。当前主流方法是指令微调,其训练 LLM 通过生成由自然语言指令引导的响应来完成现实世界任务。值得注意的是,此类方法在序列与词元分类任务上可能表现欠佳。与文本生成任务不同,分类任务具有有限的标签空间,其中精确的标签预测比生成多样且类人的响应更受重视。先前研究已揭示指令微调的 LLM 无法超越 BERT,这促使我们探索利用 LLM 的潜在表示进行有监督标签预测的潜力。在本文中,我们引入一种面向 LLM 的标签监督适配,旨在以判别性标签微调模型。我们以标签监督 LLaMA(LS-LLaMA)评估该方法,其基于 LLaMA-2-7B(一个相对小规模的 LLM),并可在单块 GeForce RTX4090 GPU 上微调。我们从最终的 LLaMA 层提取潜在表示并将其投影至标签空间以计算交叉熵损失。该模型通过低秩适配(LoRA)微调以最小化此损失。值得注意的是,在无复杂提示工程或外部知识的情况下,LS-LLaMA 大幅超越规模为其十倍的 LLM,并在文本分类上相较 BERT-Large 与 RoBERTa-Large 等鲁棒基线展现出一致改进。此外,通过移除解码器中的因果掩码,LS-unLLaMA 在命名实体识别(NER)上达到了最先进性能。我们的工作将为适配 LLM 至各类下游任务的新途径提供启示。

关键词

引用

@article{arxiv.2310.01208,
  title  = {Label Supervised LLaMA Finetuning},
  author = {Zongxi Li and Xianming Li and Yuzhang Liu and Haoran Xie and Jing Li and Fu-lee Wang and Qing Li and Xiaoqin Zhong},
  journal= {arXiv preprint arXiv:2310.01208},
  year   = {2023}
}