对齐引起的激活位移的有效秩审计:混淆控制、建设性校准与限制
摘要
我们审计了三种开源指令微调 LLM(Llama-3.1-8B-Instruct、Gemma-2-9B-it、Qwen-2.5-7B-Instruct)在与 ALIGNMENT 相关输入下残差流激活的位移,使用 ALIGNMENT 修改矩阵的有效秩对安全相关输入的 rho_eps := rank_eps(M_Ds)/d,这形式化了 Arditi 等人(2024)关于单一拒绝方向的观察结果。该论文有三个贡献。(1)混淆控制测量:四变分分解(M_naive、M_template、M_aligned、M_DiD)分离聊天模板格式化、ALIGNMENT 阶段位移以及拒绝中介方向,并在 M_DiD 上恢复 Arditi 拒绝方向,|cos| 分别为 {0.77, 0.86, 0.50}(Llama/Gemma/Qwen);聊天模板受控的 rho_eps 为 {0.0029, 0.0048, 0.0044},中心化 SVD 残差为 4-7 倍。(2)在 rho_eps 范围为 {0.008, 0.17, 0.33, 0.40} 的 3 层 MLP 上进行建设性校准,显示出一种甜点 vs. 脆弱性区分:轻度秩最大化(lambda=5)可换取抗削弱鲁棒性,而在相同 nominal rho_eps 下(lambda=50)的强正则化则不行。rho_eps 是脆弱性的诊断工具,而非可通过机械式膨胀获益鲁棒性的目标。(3)基于秩的诊断的限制:(a)不具安全性特异性(LRH 基线是安全值的 2-3 倍);(b)SVD 主序数不匹配因果序数(Llama u_2 在排名第二却不活跃;累积剔除在 k=5 时非单调);(c)需要将 O(rho_eps * d) 可达性界提升为匹配的 Mirsky-路线下界的谱间隙假设在实证上(1/90 Llama 图层-参考对、0/36 MLP 组合)和结构上(kappa_lb <= 2/(eps * r))均未通过。匹配的下界仍是一个开放问题。
引用
@article{arxiv.2605.24583,
title = {An Effective-Rank Audit of Alignment-Induced Activation Shifts: Confound Control, Constructive Calibration, and Limits},
author = {Yuki Nakamura},
journal= {arXiv preprint arXiv:2605.24583},
year = {2026}
}
备注
18 pages, 1 figure, 21 tables. Code, data, and an immutable Zenodo archive are available at https://github.com/Nakammura/effective-rank-audit (DOI: 10.5281/zenodo.20341445)