中文

关于大规模音视频学习的对抗鲁棒性

声音 2022-04-22 v2 多媒体 音频与语音处理

摘要

随着音视频系统被部署于监控和恶意内容过滤等安全关键任务,其鲁棒性仍是一个研究不足的领域。现有关于鲁棒性的已发表工作要么无法扩展到大规模数据集,要么不处理多模态。本工作旨在通过鲁棒性的视角研究多模态学习的几个关键问题:1)多模态模型是否必然比单模态模型更鲁棒?2)如何高效度量多模态学习的鲁棒性?3)如何融合不同模态以得到更鲁棒的多模态模型?为理解大规模设定下多模态模型的鲁棒性,我们提出了一种基于密度的度量和一个凸性度量,以高效度量高维潜空间中各模态的分布。我们的工作提供了理论直觉与经验证据,通过这些度量展示多模态融合如何影响对抗鲁棒性。我们进一步基于我们的度量设计了一种混合(mix-up)策略以提升训练模型的鲁棒性。我们在AudioSet和Kinetics-Sounds上的实验验证了我们的假设:面对对抗样本时,多模态模型未必比其单模态对应模型更鲁棒。我们还观察到我们混合训练的方法能获得与传统对抗训练相当的保护效果,提供了一种计算代价低廉的替代方案。实现:https://github.com/lijuncheng16/AudioSetDoneRight

关键词

引用

@article{arxiv.2203.12122,
  title  = {On Adversarial Robustness of Large-scale Audio Visual Learning},
  author = {Juncheng B Li and Shuhui Qu and Xinjian Li and Po-Yao Huang and Florian Metze},
  journal= {arXiv preprint arXiv:2203.12122},
  year   = {2022}
}