中文

面向低资源微调的联合定位与激活编辑

计算与语言 2025-05-30 v4 人工智能 机器学习

摘要

参数高效微调(PEFT)方法,如LoRA,通常用于适配大语言模型(LLMs)。然而,在仅有几百个样本的低资源场景下,标准PEFT方法的有效性受到限制。可解释性研究的最新进展催生了激活编辑(或引导)技术,这些技术修改特定模型组件的激活值。由于其极小的参数量,这些方法在小数据集上展现出潜力。然而,它们的性能高度依赖于识别正确的待编辑模块,并且在不同数据集上往往缺乏稳定性。在本文中,我们提出了联合定位与激活编辑(JoLA),该方法联合学习:(1) 需要编辑Transformer中的哪些注意力头;(2) 干预应是加性的、乘性的,还是两者兼有;(3) 干预参数本身——即作为加性偏移或乘性缩放应用于注意力头输出的向量。通过在涵盖常识推理、自然语言理解和自然语言生成的三个基准上的评估,我们证明了JoLA一致地优于现有方法。该方法的代码已发布在https://github.com/wenlai-lavine/jola。

关键词

引用

@article{arxiv.2502.01179,
  title  = {Joint Localization and Activation Editing for Low-Resource Fine-Tuning},
  author = {Wen Lai and Alexander Fraser and Ivan Titov},
  journal= {arXiv preprint arXiv:2502.01179},
  year   = {2025}
}

备注

Accepted by ICML 2025 (camera-ready version). The code is released at https://github.com/wenlai-lavine/jola