电路切断:通过定向消融移除模型行为
计算与语言
2024-01-31 v2 机器学习
摘要
语言模型常表现出一些提升预训练目标性能但损害下游任务性能的行为。我们提出一种新方法,通过消融模型组件间少量因果路径来移除不良行,旨在禁用导致该不良行为的计算电路。给定一小部分模型表现不佳的输入数据集,我们学习消融少量重要因果路径。在减少 GPT-2 毒性语言生成的设定下,我们发现仅消融 11.6K 条因果边中的 12 条即可缓解毒性生成,且对其他输入的性能退化极小。
引用
@article{arxiv.2309.05973,
title = {Circuit Breaking: Removing Model Behaviors with Targeted Ablation},
author = {Maximilian Li and Xander Davies and Max Nadeau},
journal= {arXiv preprint arXiv:2309.05973},
year = {2024}
}