Push-Pull:刻画音视觉主动说话人检测的抗对抗鲁棒性
声音
2022-10-04 v1 机器学习
多媒体
音频与语音处理
摘要
音视觉主动说话人检测(AVASD)已发展成熟,现已成为若干多模态应用不可或缺的前端。然而,据我们所知,AVASD模型的对抗鲁棒性尚未被研究,更毋论针对此类攻击的有效防御。本文中,我们首次通过大量实验揭示了AVASD模型在仅音频、仅视觉以及音视觉对抗攻击下的脆弱性。此外,我们还提出了一种新颖的音视觉交互损失(AVIL),以使攻击者在分配的攻击预算下难以找到可行的对抗样本。该损失旨在将类间嵌入推散(即非语音与语音簇充分解耦),并将类内嵌入拉紧以保持紧凑。实验结果表明,在多模态攻击下,AVIL以33.14 mAP(%)优于对抗训练。
引用
@article{arxiv.2210.00753,
title = {Push-Pull: Characterizing the Adversarial Robustness for Audio-Visual Active Speaker Detection},
author = {Xuanjun Chen and Haibin Wu and Helen Meng and Hung-yi Lee and Jyh-Shing Roger Jang},
journal= {arXiv preprint arXiv:2210.00753},
year = {2022}
}
备注
Accepted by SLT 2022