分布式手术用于语言模型激活
机器学习
2025-11-11 v2 计算与语言
最优化与控制
摘要
虽然语言模型能够生成令人惊叹且看似准确的文本,但偶尔会产生不可取的内容,包括有害或有毒的输出。本文提出了一种新的两阶段方法,通过修正激活来检测并缓解不可取的内容生成。首先,我们训练一个基于层级分类器的集成体,通过最小化风险感知得分的光滑代理来检测不可取内容。然后,对于检测到的不可取内容,我们提出了基于层级分布引导策略的变换注意力头的策略。这些策略通过原则性的半正定规划计算,旨在最小程度地扰动注意力分布,同时以概率方式保证编辑的有效性。跨多个语言模型和数据集的实证评估表明,我们的方法在减少不可取输出生成方面优于基线方法。
引用
@article{arxiv.2501.15758,
title = {Distributional Surgery for Language Model Activations},
author = {Bao Nguyen and Binh Nguyen and Duy Nguyen and Viet Anh Nguyen},
journal= {arXiv preprint arXiv:2501.15758},
year = {2025}
}
备注
3 figures