中文

从对抗视角审视音视频事件识别

计算机视觉与模式识别 2020-11-17 v1 机器学习 声音 音频与语音处理

摘要

随着音频/视觉分类模型被大规模部署于内容过滤等敏感任务,在提升准确率的同时理解其鲁棒性至关重要。本工作旨在通过对抗噪声的视角研究多模态学习相关的几个关键问题:1) 早期/中期/晚期融合的权衡如何影响其鲁棒性与准确率;2) 不同的频域/时域特征对鲁棒性有何贡献?3) 不同的神经模块如何对对抗噪声产生影响?在我们的实验中,我们构造对抗样本来攻击在 Google AudioSet 上训练的最先进神经模型。我们比较了使用不同 LpL_p 范数、大小为 ϵ\epsilon 的对抗扰动需要多少攻击强度才能“停用”受害模型。利用对抗噪声对多模态模型进行消融,我们能够深入洞察何种融合策略最能平衡模型参数量/准确率与鲁棒性的权衡,并区分各类神经网络模型倾向于学习的鲁棒特征与非鲁棒特征。

关键词

引用

@article{arxiv.2011.07430,
  title  = {Audio-Visual Event Recognition through the lens of Adversary},
  author = {Juncheng B Li and Kaixin Ma and Shuhui Qu and Po-Yao Huang and Florian Metze},
  journal= {arXiv preprint arXiv:2011.07430},
  year   = {2020}
}

备注

4 pages