模型手术:通过简单参数编辑调控大语言模型的行为
人工智能
2025-02-12 v2
摘要
大型语言模型(LLM)已展示出作为通用助手的巨大潜力,展现出强大的任务理解和问题解决能力。要将 LLM 部署为 AI 助手,关键在于这些模型表现出有希望的行为特征,如非毒性和抵抗越狱尝试的能力。当前用于去毒或防止越狱的方法通常涉及监督微调(SFT)或基于人类反馈的强化学习(RLHF),这需要通过梯度下降对数十亿参数进行微调,并具有巨大的计算成本。此外,通过 SFT 和 RLHF 修改的模型可能偏离预训练模型, potentially 导致基础 LLM 能力的降低。在本文中,我们注意到, surprisingly,直接编辑少量参数即可有效调控 LLM 的特定行为,如去毒和抵抗越狱,只需推理级别的计算资源。实验表明,在去毒任务中,我们的方法在 RealToxicityPrompts 数据集上实现了最高可达 90.0% 的毒性降低,在 ToxiGen 上实现了 49.2% 的降低,同时保持了 LLM 在常识、问答和数学等领域的通用能力。
引用
@article{arxiv.2407.08770,
title = {Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing},
author = {Huanqian Wang and Yang Yue and Rui Lu and Jingxin Shi and Andrew Zhao and Shenzhi Wang and Shiji Song and Gao Huang},
journal= {arXiv preprint arXiv:2407.08770},
year = {2025}
}
备注
23 pages, 14 figures