线性探针在人格坐标中是否具有更好的泛化能力?
人工智能
2026-05-18 v2
摘要
在语言模型交互过程中,使用监视器检查有害行为变得越来越必要,但仅基于文本的监视并不充分。这是因为模型有时会表现出策略性欺骗和藏拙,在评估期间改变其行为。这促使了使用线性探针等白盒监视器,直接读取模型内部状态。目前,此类探针在分布偏移下可能会失效,限制了其在真实场景中的实用性。我们研究模型内部是否存在一个低维子空间,能够更稳健地捕捉有害行为,同时排除伪相关特征。受 Assistant Axis 和 Persona Selection Model 启发,我们使用对比人格提示构建了欺骗和谄媚的人格轴。通过对人格特定向量进行无监督 PCA 获得的第一主成分,能够清晰地区分有害与无害人格。在 10 个评估数据集上,我们表明源自人格的方向具有显著的迁移性,且基于人格主成分投影训练的探针比基于原始激活值训练的探针泛化能力更强。我们还发现,由多种有害和无害行为组成的统一轴能改善跨行为和跨数据集的泛化能力。总体而言,人格向量为构建更具可迁移性的行为探针提供了有用的归纳偏置。
引用
@article{arxiv.2605.09391,
title = {Do Linear Probes Generalize Better in Persona Coordinates?},
author = {Prasad Mahadik and Adrians Skapars},
journal= {arXiv preprint arXiv:2605.09391},
year = {2026}
}
备注
15 pages, preprint. Revised version: corrected references and citation links; results unchanged