无痛激活引导:面向大型语言模型后训练的自动化、轻量方法
计算与语言
2026-05-18 v3 人工智能
机器学习
机器学习
摘要
语言模型(LMs)通常通过基于权重或基于提示的引导进行后训练以实现期望的功能和行为,但前者耗时且昂贵,后者难以精确控制且常需手动试错。尽管激活引导(AS)作为两种现有后训练方法的替代方案,承诺更便宜、更快速且更可控,但当前 AS 技术需要人工构建提示对或耗时的特征标注,使其不如强化学习(RL)和监督微调(SFT)这类即插即用方法方便。我们引入无痛激活引导(PAS),这是一系列完全自动化的方法,使 AS 能够与任何给定的标记数据集配合使用,无需提示构建、特征标注或人工干预。我们在三个开源权重模型(Llama3.1-8B-Instruct、DeepSeek-R1-Distill-8B、Nous-Hermes-2)和 18 个任务上进行评估;我们发现 PAS 在行为任务上可靠地提升性能,但在智力导向任务上不表现出色。其内省变体(iPAS)可实现最强的因果引导效果(偏见方面提升 10.1%,道德方面提升 5.2%,对齐方面提升 34.8%)。我们还展示 PAS 能在基于上下文学习(ICL)和 SFT 的基础上获得额外收益。PAS 构建了一个快速、轻量级的激活向量,可低成本训练、轻松存储和随时激活。我们的结果为描绘 AS 在何时有效、何时失败以及如何作为实用、自动化的 LM 后训练选项进行部署提供了指引。
引用
@article{arxiv.2509.22739,
title = {Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models},
author = {Sasha Cui and Zhongren Chen},
journal= {arXiv preprint arXiv:2509.22739},
year = {2026}
}