通过传递激活来控制语言和扩散模型
机器学习
2024-11-25 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
大型生成模型日益增强的能力以及其日益广泛的部署引发了关于其可靠性、安全性以及潜在滥用问题的担忧。为此,近期研究提出通过引导模型激活来控制模型生成,以有效诱导或防止生成输出中出现特定概念或行为。本文我们引入激活传递(AcT),一种通用的框架来引导激活,基于最优传输理论,对许多先前的激活引导工作进行了概括。AcT 是模态无关的,可提供对模型行为的细粒度控制,同时以可忽略的计算开销实现,且对模型能力影响最小。我们通过在大型语言模型(LLMs)和文本到图像扩散模型(T2Is)中应用于关键挑战,实验性地展示了该方法的有效性和通用性。对于 LLMs,我们表明 AcT 可有效缓解有害输出、诱导任意概念以及提高其真实性。在 T2Is,我们展示了 AcT 如何实现细粒度的风格控制和概念否定。
引用
@article{arxiv.2410.23054,
title = {Controlling Language and Diffusion Models by Transporting Activations},
author = {Pau Rodriguez and Arno Blaas and Michal Klein and Luca Zappella and Nicholas Apostoloff and Marco Cuturi and Xavier Suau},
journal= {arXiv preprint arXiv:2410.23054},
year = {2024}
}