Llama SLayer 8B:浅层层次是知识注入的关键
计算与语言
2024-10-04 v1
摘要
作为增强预训练大语言模型(LLM)的一种方式,知识注入对于开发垂直领域大模型具有关键意义,且已受到广泛关注。虽然目前大多数方法,包括参数高效微调(PEFT)和块扩展方法,都在均匀应用于所有 LLM 层,但这引发了一个问题:所有层在知识注入中是否同样重要?我们首先评估每个层的重要性,以寻找知识注入的最优层范围。直观地说,更重要的层应该在知识注入中发挥更关键的作用,因而应获得更稠密的注入。我们观察到在删除或扩展浅层后,问答基准测试的性能会出现下降,而这种降解随着层级变深而减小,表明浅层层次是知识注入的关键。这一洞察导致我们提出了 S 策略,即一种选择性加强浅层层次同时削减效应较差的深层层次的后预训练策略。基于此策略,我们介绍了 Llama Slayer-8B 和 Llama Slayer-8B-Instruct。我们在代码与数学语料库上进行实验,证明了该策略的有效性。进一步的实验在不同的 LLM、Mistral-7B 以及法律语料库上确认了该方法的普遍适用性,凸显了其广泛的有效性。我们的代码可在 \https://github.com/txchen-USTC/Llama-Slayer 上获取。
引用
@article{arxiv.2410.02330,
title = {Llama SLayer 8B: Shallow Layers Hold the Key to Knowledge Injection},
author = {Tianxiang Chen and Zhentao Tan and Tao Gong and Yue Wu and Qi Chu and Bin Liu and Jieping Ye and Nenghai Yu},
journal= {arXiv preprint arXiv:2410.02330},
year = {2024}
}