通过权重对称性规避后门空间
信息检索
2025-11-25 v3
摘要
深度神经网络对后门攻击高度脆弱,这类攻击在训练期间植入恶意行为。虽然现有防御方法能够有效净化受感染模型,但通常需要标记数据或特定的训练程序,限制了其在监督学习之外的应用。值得注意的是,近期研究表明后门攻击已成功跨越至各种学习范式,凸显了严重的安全隐患。为填补这一空白,我们提出了 Two-stage Symmetry Connectivity(TSC),一种新颖的后门净化防御方法,能够独立于数据格式并仅需少量干净样本即可工作。通过理论分析,我们证明了利用神经网络中的置换不变性和二次模式连接性,TSC 能够放大受毒化样本的损失,同时保持受控的干净准确率。实验结果表明,TSC 在监督学习场景下的性能稳健,与最先进的方法相当。此外,TSC 能有效推广至自监督学习框架,如 SimCLR 和 CLIP,保持其强大的防御能力。我们的代码已公开于 https://github.com/JiePeng104/TSC。
引用
@article{arxiv.2506.07466,
title = {Capturing User Interests from Data Streams for Continual Sequential Recommendation},
author = {Gyuseok Lee and Hyunsik Yoo and Junyoung Hwang and SeongKu Kang and Hwanjo Yu},
journal= {arXiv preprint arXiv:2506.07466},
year = {2025}
}
备注
WSDM'26