中文

表示手术:仿射引导的理论与实践

机器学习 2025-06-05 v7 计算与语言 计算机与社会

摘要

语言模型经常表现出不良行为,例如生成有毒或性别偏见的文本。在神经语言模型的情况下,不良行为的编码通常存在于模型的表示中。因此,一种自然(且常见)的防止模型表现出不良行为的方法是,以降低生成不良文本概率的方式引导模型的表示。本文研究了引导函数的正式和实证性质,即改变神经语言模型表示以改变其行为的变换。首先,我们在不同约束下推导出两个最优(在最小二乘意义上)的仿射引导函数。我们的理论为现有方法提供了合理性,并提供了一种新颖的、改进的引导方法。其次,我们提供了一系列实验,证明了这些方法在减轻偏见和减少有毒生成方面的实证有效性。

关键词

引用

@article{arxiv.2402.09631,
  title  = {Representation Surgery: Theory and Practice of Affine Steering},
  author = {Shashwat Singh and Shauli Ravfogel and Jonathan Herzig and Roee Aharoni and Ryan Cotterell and Ponnurangam Kumaraguru},
  journal= {arXiv preprint arXiv:2402.09631},
  year   = {2025}
}

备注

Accepted in ICML 2024