面向生成模型的中等引导:最优仿射框架 MidSteer
机器学习
2026-05-08 v1 人工智能
摘要
引导中间表示已成为控制生成模型的强大策略,特别是在部署后对齐和安全方面的应用。然而,尽管该方法在实证研究中取得成功,却缺乏完整的理论框架。在本文中,我们通过形式化概念引导的理论,弥合了这一差距。首先,我们建立了引导与仿射概念抹除之间的联系,证明了标准的去除不希望行为的方法是 LEACE(一种仿射抹除的闭形式方法)的特例。随后,我们构建原则性的理论框架用于概念切换,LEACE-Switch,并刻画了其提供 optimal 仿射解的假设条件。基于此分析,我们进而引入 MidSteer(Minimal Disturbance concept Steering),一个更为 general 的仿射框架用于概念操控,放宽了这些假设,实现 directed、最小扰动的变换。我们展示 MidSteer 在各种任务、模态和架构上均表现良好,包括视觉扩散模型和大语言模型。
引用
@article{arxiv.2605.05220,
title = {MidSteer: Optimal Affine Framework for Steering Generative Models},
author = {Tatiana Gaintseva and Andrew Stepanov and Ziquan Liu and Martin Benning and Gregory Slabaugh and Jiankang Deng and Ismail Elezi},
journal= {arXiv preprint arXiv:2605.05220},
year = {2026}
}