中文

激活差异揭示后门:SAE 架构比较

计算与语言 2026-05-11 v1 人工智能 密码学与安全 机器学习

摘要

语言模型的后门攻击是 AI 安全中的重大威胁,模型在大多数输入上表现正常,但在被特定模式触发时会 exhibit 有害行为。通过机制解释学派检测此类后门仍是开放挑战。我们研究了两种稀疏自编码器架构——Crosscoders 和 Differential SAEs (Diff-SAE)——用于在微调模型中隔离后门相关特征。使用受控 SQL 注入后门进行测试,该后门通过基于年份的上下文触发(年份为"2024"时触发有害代码,"2023"时触发安全代码),我们在 SmolLM2-360M 上评估了两种方法在 LoRA 和全秩微调情景下的表现。我们发现 Diff-SAE 在后门隔离方面始终且显著地优于 Crosscoders。Diff-SAE 在大多数实验条件下实现了 0.40 的后门隔离分数(BIS),并实现完美精确度(1.0)和零误报率,而 Crosscoders 在大多数情况下几乎完全失败,BIS 低于 0.02。这种性能差距在多个 Transformer 层(14、18、22、26)和两种微调情景中都保持不变,其中全秩微调产生的后门信号尤为干净。我们的结果表明,后门表现为激活方向的偏移,而非稀疏特征激活,使得基于差异的表示在检测方面具有根本性优势。这些发现对 AI 安全监控和开发检测模型操纵的可解释性工具具有重要意义。

关键词

引用

@article{arxiv.2605.07324,
  title  = {Activation Differences Reveal Backdoors: A Comparison of SAE Architectures},
  author = {Sachin Kumar},
  journal= {arXiv preprint arXiv:2605.07324},
  year   = {2026}
}

备注

Accepted at IJCNN 2026 (IEEE WCCI). \copyright 2026 IEEE