视觉 Transformer 中的后门方向
计算机视觉与模式识别
2026-03-12 v1 密码学与安全
摘要
本文探讨了后门攻击在视觉 Transformer (ViT) 中的表示方式。通过假设已知触发器,我们识别出模型激活中对应于触发器内部表示的特定“触发器方向”。我们通过在激活空间和参数空间中进行干预,证明了这种线性方向在多个数据集和攻击类型下都能一致调制模型的后门行为。将该方向用作诊断工具,我们追踪了后门特征在各层中的处理方式。我们的分析揭示了不同质质的差异:静态补丁触发器遵循不同的内部逻辑,而隐蔽的分布式触发器则不同。我们进一步检验了后门与对抗性攻击之间的关系,具体测试 PGD-based 扰动是否(去)激活所识别的触发器机制。最后,我们提出一种无数据、基于权重的针对隐蔽触发器攻击的检测方案。我们的发现表明,机制可解释性为诊断和解决计算机视觉中的安全漏洞提供了稳健的框架。
引用
@article{arxiv.2603.10806,
title = {Backdoor Directions in Vision Transformers},
author = {Sengim Karayalcin and Marina Krcek and Pin-Yu Chen and Stjepan Picek},
journal= {arXiv preprint arXiv:2603.10806},
year = {2026}
}
备注
31 pages, 16 figures