中文

继承的回路,习得的语义:微调如何产生标准评估不可见的规避漏洞

密码学与安全 2026-06-25 v1 人工智能

摘要

为安全分类微调的 LLM 通常在与其训练数据同分布的保留样本上进行评估。我们表明这种做法可能遗漏微调本身引入的漏洞:模型可习得词元级指标语义,在保持规范准确率的同时,于 PowerShell 别名替换、命令重构、字符串构造、执行间接化与大小写变异等行为保持型变换下失效。我们在匹配的 PowerShell 分类队列上研究 Foundation-Sec-8B-Instruct 及其基础模型 Llama-3.1-8B-Instruct。因果干预将分类回路定位为继承自 Llama 的晚期注意力路径,而非由微调创建。微调集中并语义特化这一继承结构,在改善基线行为的同时创造出对变换敏感的攻击面。一个三级规避基准发现 Foundation-Sec 在 iwr 替换、Invoke-Expression 重构以及大小写变异的 Invoke-Expression/IEX 变体上漏判,而 Llama 不存在此类问题。我们还推导出一种部署前监测方法:分类边界处的线性探针与指标词元符号测试可识别微调后规范指标改变角色的命令族。这些信号仅使用规范输入即可优先生成红队变体,表明安全微调可在提升任务准确率的同时扩大规避面。这些结果警示不应将小型任务特定微调模型简单视为更安全的分类器:特化可将继承的模型结构转化为脆弱的指标规则,在保持保留样本准确率的同时扩大规避面。稳健的 AI 赋能安全需要明确任务的完整变换空间并监测微调过程中的语义漂移。

关键词

引用

@article{arxiv.2606.27091,
  title  = {Inherited Circuits, Learned Semantics: How Fine-Tuning Creates Evasion Vulnerabilities Invisible to Standard Evaluation},
  author = {Ryan Fetterman},
  journal= {arXiv preprint arXiv:2606.27091},
  year   = {2026}
}