中文

LoRA 适配器的谱几何结构编码了训练目标并预测有害行为

机器学习 2026-04-13 v1

摘要

我们研究低秩谱摘要能否识别语言模型上应用了哪种微调目标,以及该几何信号是否预测下游行为是否有害。在对 \texttt{Llama-3.2-3B-Instruct} 进行预注册实验中,我们制造了 38 个 LoRA 适配器,涵盖四类:健康的 SFT 基线、DPO 在反向无害偏好上、DPO 在反向有用偏好上以及激活引导派生的适配器,提取每层谱特征(范数、稳定秩、奇异值熵、有效秩和奇异向量与健康质心的余弦对齐)。在单一训练方法(DPO)内部,逻辑回归分类器在二元漂移检测、所有六两两目标比较以及近乎完美的有序严重性排序(ρ0.956\rho \geq 0.956)上实现 AUC~1.00。对展平后的权重 delta 进行主成分分析显示,训练目标是 PC1(目标分离 AUC~1.00),与训练持续时间在 PC2 上正交。查询投影权重检测到漂移发生;价值投影权重识别具体的目标。跨方法泛化完全失败:DPO 训练的分类器将所有引导适配器的漂移得分都低于所有 DPO 适配器(AUC~0.00)。在行为评估阶段,DPO 反向无害性适配器在 HEx-PHI 提示上显示出 elevated 有害合规(平均 ASR 0.266 vs.\ 健康 0.112,Δ=+0.154\Delta = +0.154),并呈现近乎完美的剂量-反应关系(ρ=0.986\rho = 0.986)。几何到行为的相关系数在 24 个非引导适配器上为 ρ=0.72\rho = 0.72。这些结果在受控制造条件下表明,LoRA 权重空间的几何结构携带目标身份、强度排序以及对有害合规的粗略关联,且跨方法监控需要按方法校准。

关键词

引用

@article{arxiv.2604.08844,
  title  = {Spectral Geometry of LoRA Adapters Encodes Training Objective and Predicts Harmful Compliance},
  author = {Roi Paul},
  journal= {arXiv preprint arXiv:2604.08844},
  year   = {2026}
}

备注

15 pages, 8 figures, pre-registered experiment, data at https://github.com/roip/task-geometry-experiment-results