中文

基于神经元激活空间对抗学习的视觉问答实例级木马攻击

计算机视觉与模式识别 2024-03-19 v2 人工智能

摘要

木马攻击在输入数据中嵌入扰动,导致神经网络模型出现恶意行为。不同模态中多种木马的组合使攻击者能够对视觉问答(VQA)等多模态学习发起复杂攻击。然而,常规方法中的多模态木马在微调等过程中易受参数调整的影响。为此,我们提出了一种针对 VQA 的实例级多模态木马攻击,它通过双模态对抗学习方法高效适应微调后的模型。该方法破坏预训练模型中特定扰动层内的两个特定神经元,以产生过大的神经元激活。随后,通过对抗学习在这些过度活跃的神经元与微调后模型的恶意输出之间建立恶意关联。使用 VQA-v2 数据集,基于包括样本效率、隐蔽性和鲁棒性在内的广泛指标进行了大量实验。所提出的攻击针对每个样本定制不同的视觉与文本木马,展现出增强的性能。我们证明,通过仅注入少量木马样本,所提出的攻击可高效适应不同的微调模型。此外,我们研究了在常规防御下的攻击性能,结果表明这些防御无法有效缓解该攻击。

关键词

引用

@article{arxiv.2304.00436,
  title  = {Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space},
  author = {Yuwei Sun and Hideya Ochiai and Jun Sakuma},
  journal= {arXiv preprint arXiv:2304.00436},
  year   = {2024}
}

备注

Accepted for IJCNN 2024