潜在层改写:通过层扰动改进语言模型中的知识注入
计算与语言
2024-11-04 v1 人工智能
摘要
随着大型语言模型(LLMs)越来越多地部署在专业知识领域并面临持续演变的知识,及时且精确的知识注入已成为必需。通过改写数据进行微调是增强知识注入的常用方法,但面临两个重大挑战:由于重复调用外部模型导致的高计算成本以及样本多样性有限。为此,我们提出 LaPael,一种潜在层改写方法,对 LLM 早期层施加输入依赖的噪声。该方法直接在模型内部实现多样且语义一致的增强。此外,它消除了每次知识更新时重复进行改写生成的成本。我们在问答基准上的大量实验表明,LaPael 在知识注入方面优于标准微调和现有的基于噪声的方法。此外,将 LaPael 与数据层改写相结合可进一步提升性能。
引用
@article{arxiv.2411.00686,
title = {Latent Paraphrasing: Perturbation on Layers Improves Knowledge Injection in Language Models},
author = {Minki Kang and Sung Ju Hwang and Gibbeum Lee and Jaewoong Cho},
journal= {arXiv preprint arXiv:2411.00686},
year = {2024}
}
备注
NeurIPS 2024