我们到底能控制什么?激活控制的多行为研究
人工智能
2026-01-13 v2
摘要
大语言模型(LLM)需要精确的行为控制,以实现在各类应用中的安全和高效部署。激活控制是一种可行的LLM行为控制方法。我们聚焦于如何不同行为类型的控制效果各异,以及目标行为的性质是否能预测控制成功的问题。通过对50种行为类型的激活控制进行经验性分析来回答这些问题。这些行为涵盖人物原型、性格特质、误差行为、风格线索以及模仿名人等。我们提出一系列全面的实验,涵盖系数优化、向量属性和数据需求,为激活控制的实现提供全面指导。我们的分析表明,控制效果在行为类型上差异显著,不同行为类别对干预强度的反应模式各不相同。我们发现,特质表达遵循抛物线曲线,随着控制系数强度而变化。我们还表明,向量分离指标不预测控制效果,但更大的训练数据集可实现更激进的控制。这些发现为激活控制的实现提供了以经验为依据的指导,表明控制效果深受行为类型的影响。
引用
@article{arxiv.2511.18284,
title = {What Can We Actually Steer? A Multi-Behavior Study of Activation Control},
author = {Tetiana Bas and Krystian Novak},
journal= {arXiv preprint arXiv:2511.18284},
year = {2026}
}