只学习有效适配器能表达的内容:针对微调投毒的约束子空间适配
机器学习
2026-07-06 v1 密码学与安全
摘要
参数高效微调仍然为改变行为的更新留下了广阔的可达空间,因此中毒目标可以被表示和优化。我们研究了一种替代方案:适配被约束在从可信的现有任务适配器池中估计的子空间内。在flan-t5-large上使用196个公共LoRA适配器,我们表明:(1)适配器的功能相关内容位于低维共享子空间中,在评估的任务分布下,其权重范数的30%到38%是冗余的;(2)在此子空间的128个坐标上限制的梯度适配在干净分类数据上匹配完整的LoRA微调,而在目标标签反转下,LoRA崩溃到3-26%的精确匹配,而受限学习器在池覆盖的任务上保持62-96%;(3)受限学习器无法拟合损坏数据,其适配损失将干净数据与垃圾数据分开两个数量级(120倍),这是一个无需额外检测器的分布外信号;(4)针对在子空间内优化的自适应后门攻击者,在其目标行为与池中任何内容都不相似的任务上,攻击被阻止(成功率为8%,而LoRA为100%),而当目标与常见池行为一致时,仅被部分阻止(85%)。在这两个任务上,结果与目标与池方向的距离一致,这暗示但并未确定一个池相对边界。该机制以峰值可塑性换取这些属性:在池覆盖不佳的任务上,无约束微调获胜,并且保护假设池本身是可信的。代码和数据是公开的。
引用
@article{arxiv.2607.05300,
title = {Learning Only What Valid Adapters Can Express: Subspace-Constrained Adaptation Against Fine-Tuning Poisoning},
author = {Fabien Polly},
journal= {arXiv preprint arXiv:2607.05300},
year = {2026}
}
备注
10 pages, 7 figures, 2 tables. Code and data: https://github.com/infinition/z-manifold