探究任务特定提示与稀疏自编码器用于激活监控
机器学习
2025-04-30 v1
摘要
语言模型可能以意想不到的和不安全的方式行为,因此值得监控其输出。语言模型的内部激活 (internal activations) 编码了可能对此有用的额外信息。激活监控的基准方法是对特定网络层进行某种形式的线性探测:从标记数据集开始,在该层的激活上训练逻辑回归分类器。最近的工作提出了几种可能改进于朴素线性探测的方法,利用额外的计算。一类技术称为 "prompted probing" (提示探测),通过 (1) 用监控任务的描述对模型进行提示 (prompting),以及 (2) 对 resulting activations 应用已学习的线性探测器来提高监控效果。另一类技术是在训练时进行计算:离线训练稀疏自编码器 (sparse autoencoders, SAE) 以识别激活的可解释基 (interpretable basis),例如在该基上对 token 进行最大池化 (max-pooling) 后再应用线性探测器。然而,一种方法也是对模型进行监控任务描述的提示,并直接使用其输出。我们开发并测试了这些方法的新颖改进方案,并对其进行比较。我们发现,在推理时间计算有限时,要求模型零-shot 是一个合理的基准;然而,给定充足的训练数据,激活探测方法可以显著超越该基准。具体而言,我们建议在推理时间计算可用时使用提示探测,因为其在数据效率方面优越且具有良好的泛化性能。或者,如果推理时间计算有限,我们发现基于 SAE 的探测方法在原始激活探测方面表现更好。
引用
@article{arxiv.2504.20271,
title = {Investigating task-specific prompts and sparse autoencoders for activation monitoring},
author = {Henk Tillman and Dan Mossing},
journal= {arXiv preprint arXiv:2504.20271},
year = {2025}
}
备注
18 pages, 13 figures