TAIA: 大语言模型是分布外数据的学习者
计算与语言
2024-10-18 v2
摘要
在特定任务的问答对上微调是增强指令微调大语言模型在下游任务上性能的主要方法。然而,在某些专业领域,例如医疗或无害内容生成,几乎不可能获得大量与下游分布匹配的高质量数据。为了在数据稀缺领域使用领域不匹配数据提升大语言模型的性能,我们重新评估了Transformer架构,并发现微调期间并非所有参数更新都对下游性能有积极贡献。我们的分析表明,在自注意力网络和前馈网络中,当训练集的分布与测试集不完全一致时,只有微调后的注意力参数特别有益。基于这一发现,我们提出了一种有效的推理时干预方法:训练所有参数但仅用注意力进行推理(\trainallInfAttn)。我们使用两个通用指令微调数据集对\trainallInfAttn进行了实证验证,并在涉及数学、推理和知识理解的七个下游任务上,对不同参数规模和微调技术的大语言模型进行了评估。我们的综合实验表明,在大多数场景下,\trainallInfAttn相比完全微调模型和基础模型都取得了更优的改进,并带来了显著的性能提升。\trainallInfAttn对数据不匹配的高容忍度使其能够抵抗越狱微调,并利用通用数据增强专业任务。代码可在\url{https://github.com/pixas/TAIA_LLM}获取。
引用
@article{arxiv.2405.20192,
title = {TAIA: Large Language Models are Out-of-Distribution Data Learners},
author = {Shuyang Jiang and Yusheng Liao and Ya Zhang and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2405.20192},
year = {2024}
}
备注
29 pages. Accepted as a 2024 NeurIPS paper