LoFiT:对 LLM 表示进行局部精调
计算与语言
2024-11-01 v2
摘要
最近的可解释性工作表明,大型语言模型(LLMs)可以以无学习方式适应新任务:对 LLM 表示进行干预以诱发特定对齐行为。例如,为特定注意力头的输出添加 Certain bias 向量可提升模型的真实性。在本文中,我们表明局部精调是此类表示干预方法的有效替代方案。我们引入了一个名为 Localized Fine-tuning on LLM Representations(LoFiT)的框架,它识别最重要于学习特定任务的注意力头子集,然后训练 offset 向量以添加到所选注意力头的模型隐藏表示中。LoFiT 定位到稀疏的头集合(3%-10%),并从有限的训练数据中学习 offset 向量,类似于用于表示干预的设置。在真实性和推理任务方面,我们发现 LoFiT 的干预向量比诸如 Inference-time Intervention 等表示干预方法的向量更有效。我们还发现,定位步骤很重要:选择特定于任务的注意力头可导致更好的性能,而不是针对不同任务选择的注意力头。在我们研究的 7 个任务中,LoFiT 尽管修改的参数比这些方法少 20 倍到 200 倍,仍能实现与诸如 LoRA 等参数高效精调方法相当的性能。
引用
@article{arxiv.2406.01563,
title = {LoFiT: Localized Fine-tuning on LLM Representations},
author = {Fangcong Yin and Xi Ye and Greg Durrett},
journal= {arXiv preprint arXiv:2406.01563},
year = {2024}
}
备注
NeurIPS 2024 Camera Ready