CRaFT:通过跨层转码器实现电路引导的拒绝特征选择
人工智能
2026-05-28 v2
摘要
虽然现代LLM已对齐以拒绝有害请求,但理解这种拒绝行为的底层机制基础对于模型安全分析至关重要。例如,基于引导的越狱攻击通过识别和操纵稀疏的神经元式拒绝特征来绕过安全护栏。当前特征选择方法主要依赖特征在有害提示上的激活强度。然而,激活强度本身往往只捕捉表面启发式特征,如主题或词汇线索,而非真正的因果机制。因此,选择拒绝特征需要测量特征间的关系,而非将每个特征视为孤立的激活信号。基于这一洞察,我们提出了CRaFT,一个电路引导的框架,用于识别直接支配拒绝决策的关键拒绝特征。CRaFT利用跨层转码器将模型的内部计算映射到稀疏特征电路图中,其中边量化特征间的影响及其对最终输出logits的贡献。通过聚合沿拒绝路径传播的效果,CRaFT有效地对最具影响力的特征进行排序。在四个越狱基准上的广泛评估表明,CRaFT将平均性能从6.7%显著提升至57.4%,并生成比当前最先进方法更具特异性的有害补全。
引用
@article{arxiv.2604.01604,
title = {CRaFT: Circuit-Guided Refusal Feature Selection via Cross-Layer Transcoders},
author = {Su-Hyeon Kim and Hyundong Jin and Yejin Lee and Yo-Sub Han},
journal= {arXiv preprint arXiv:2604.01604},
year = {2026}
}