视听融合能否在多模态攻击下增强鲁棒性?
计算机视觉与模式识别
2021-04-06 v1 密码学与安全
声音
音频与语音处理
摘要
本文中,我们提议对攻击下机器的多感官感知进行系统性研究。我们以视听事件识别任务对抗多模态对抗攻击为代理,探究视听学习的鲁棒性。我们攻击音频、视觉及双模态,以探索视听融合是否仍增强感知,以及不同融合机制如何影响视听模型的鲁棒性。为解释攻击下的多模态交互,我们学习了一个弱监督声源视觉定位模型以定位视频中的发声区域。为缓解多模态攻击,我们提出一种基于视听不相似约束与外部特征记忆库的视听防御方法。大量实验表明:视听模型易受多模态对抗攻击;在多重攻击下视听融合反而降低模型鲁棒性而非增强;即便是弱监督声源视觉定位模型也能被成功欺骗;我们的防御方法可在不显著牺牲干净模型性能的前提下提升视听网络的抗攻击能力。
引用
@article{arxiv.2104.02000,
title = {Can audio-visual integration strengthen robustness under multimodal attacks?},
author = {Yapeng Tian and Chenliang Xu},
journal= {arXiv preprint arXiv:2104.02000},
year = {2021}
}
备注
CVPR 2021