ROAST:基于滚动的分布内激活引导技术
机器学习
2026-02-17 v1 计算与语言
摘要
激活引导通过推断方法在推理阶段提供了对大语言模型(LLM)的参数高效控制,但许多方法依赖离分布监督和离散掩码,导致干预脆弱。我们提出ROAST(Rollout-based On-distribution Activation Steering Technique,即基于滚动的分布内激活引导技术),其通过ROC从模型自身的分布内滚动中估计引导方向,并通过连续软缩放(CSS)和分组均值归一化避免硬稀疏化。我们的实证分析揭示,尽管激活幅度与方向一致性呈中等相关性,但幅度的方差显著且常常不成比例于语义质量。这表明若不进行适当归一化,高幅度激活风险主导全局引导方向。为此,ROAST采用分组归一化以平衡样本间的贡献,确保更稳健的共识引导方向估计。跨模型(0.6B至32B),ROAST在 diverse 任务上 consistently 提升性能(例如Qwen3-0.6B上的GSM8K提升+9.7%,GLM4-32B上的TruthfulQA提升+12.1%),且分析表明CSS更好地保留了激活能量。
引用
@article{arxiv.2602.14143,
title = {ROAST: Rollout-based On-distribution Activation Steering Technique},
author = {Xuanbo Su and Hao Luo and Yingfang Zhang and Lijun Zhang},
journal= {arXiv preprint arXiv:2602.14143},
year = {2026}
}