LoRA 适配器的谱几何结构编码了训练目标并预测有害行为
机器学习
2026-04-13 v1
摘要
我们研究低秩谱摘要能否识别语言模型上应用了哪种微调目标,以及该几何信号是否预测下游行为是否有害。在对 \texttt{Llama-3.2-3B-Instruct} 进行预注册实验中,我们制造了 38 个 LoRA 适配器,涵盖四类:健康的 SFT 基线、DPO 在反向无害偏好上、DPO 在反向有用偏好上以及激活引导派生的适配器,提取每层谱特征(范数、稳定秩、奇异值熵、有效秩和奇异向量与健康质心的余弦对齐)。在单一训练方法(DPO)内部,逻辑回归分类器在二元漂移检测、所有六两两目标比较以及近乎完美的有序严重性排序()上实现 AUC~1.00。对展平后的权重 delta 进行主成分分析显示,训练目标是 PC1(目标分离 AUC~1.00),与训练持续时间在 PC2 上正交。查询投影权重检测到漂移发生;价值投影权重识别具体的目标。跨方法泛化完全失败:DPO 训练的分类器将所有引导适配器的漂移得分都低于所有 DPO 适配器(AUC~0.00)。在行为评估阶段,DPO 反向无害性适配器在 HEx-PHI 提示上显示出 elevated 有害合规(平均 ASR 0.266 vs.\ 健康 0.112,),并呈现近乎完美的剂量-反应关系()。几何到行为的相关系数在 24 个非引导适配器上为 。这些结果在受控制造条件下表明,LoRA 权重空间的几何结构携带目标身份、强度排序以及对有害合规的粗略关联,且跨方法监控需要按方法校准。
引用
@article{arxiv.2604.08844,
title = {Spectral Geometry of LoRA Adapters Encodes Training Objective and Predicts Harmful Compliance},
author = {Roi Paul},
journal= {arXiv preprint arXiv:2604.08844},
year = {2026}
}
备注
15 pages, 8 figures, pre-registered experiment, data at https://github.com/roip/task-geometry-experiment-results