TED++: 基于层次管状邻域筛查的子流形感知后门检测
机器学习
2025-10-17 v1 人工智能
摘要
随着深度神经网络为越来越关键的应用提供了越来越多的能力,隐蔽后门攻击——即在看似良性的受感染训练输入下触发恶意模型行为——构成了严重的安全风险。许多现有防御措施在攻击者利用细微基于距离的异常或干净示例稀缺时会受到攻击。为应对这一挑战,我们引入了 TED++,一种子流形感知框架,有效检测那些能规避现有防御措施的隐蔽后门。TED++ 通过在每个类的隐藏特征子流形周围构建管状邻域,估计其局部“厚度”(仅需少量干净激活),然后应用局部自适应排序 (LAR) 来检测任何偏离可接受管 tube 的激活。通过聚合跨所有层的 LAR 调整后的排名,TED++ 捕获了输入在演化类子流形上的忠实程度。基于此类“管状约束”行为,TED++ 会标记那些基于 LAR 排序序列显著偏离的输入。在基准数据集和任务上进行了大量实验,表明 TED++ 在自适应攻击和有限数据情境下均实现了状态的最佳检测性能。值得注意的是,即使仅使用每个类别的五个 held-out 示例,TED++ 仍能实现近乎完美的检测,相较于下一最佳方法提升了最高可达 14% 的 AUROC。代码已公开于 https://github.com/namle-w/TEDpp。
引用
@article{arxiv.2510.14299,
title = {TED++: Submanifold-Aware Backdoor Detection via Layerwise Tubular-Neighbourhood Screening},
author = {Nam Le and Leo Yu Zhang and Kewen Liao and Shirui Pan and Wei Luo},
journal= {arXiv preprint arXiv:2510.14299},
year = {2025}
}
备注
Accepted by ICDM 2025