中文

教我欺骗:通过知识蒸馏探索对抗性迁移性

机器学习 2025-07-30 v1 人工智能

摘要

我们研究了从多个异构教师模型进行知识蒸馏(knowledge distillation, KD)是否可以增强可迁移对抗样本的生成。我们采用两种KD策略:基于课程的切换和联合优化,对ResNet50和DenseNet-161作为教师模型训练一个轻量级学生模型。然后使用FG、FGS和PGD攻击方法生成对抗样本,并在黑箱目标模型(GoogLeNet)上进行评估。我们的实验结果表明,来自多个教师模型蒸馏的学生模型在攻击成功率上与基于集成的基线相当,但将对抗样本生成时间缩短最高可缩短六倍。进一步的消融研究揭示,较低的温度设置和硬标签监督的包含显著提升了迁移性。这些发现表明,KD不仅是模型压缩技术,更是提高黑箱对抗攻击效率和效果的强大工具。

关键词

引用

@article{arxiv.2507.21992,
  title  = {Teach Me to Trick: Exploring Adversarial Transferability via Knowledge Distillation},
  author = {Siddhartha Pradhan and Shikshya Shiwakoti and Neha Bathuri},
  journal= {arXiv preprint arXiv:2507.21992},
  year   = {2025}
}

备注

10 pages, 4 figures