中文

Push-Pull:刻画音视觉主动说话人检测的抗对抗鲁棒性

声音 2022-10-04 v1 机器学习 多媒体 音频与语音处理

摘要

音视觉主动说话人检测(AVASD)已发展成熟,现已成为若干多模态应用不可或缺的前端。然而,据我们所知,AVASD模型的对抗鲁棒性尚未被研究,更毋论针对此类攻击的有效防御。本文中,我们首次通过大量实验揭示了AVASD模型在仅音频、仅视觉以及音视觉对抗攻击下的脆弱性。此外,我们还提出了一种新颖的音视觉交互损失(AVIL),以使攻击者在分配的攻击预算下难以找到可行的对抗样本。该损失旨在将类间嵌入推散(即非语音与语音簇充分解耦),并将类内嵌入拉紧以保持紧凑。实验结果表明,在多模态攻击下,AVIL以33.14 mAP(%)优于对抗训练。

关键词

引用

@article{arxiv.2210.00753,
  title  = {Push-Pull: Characterizing the Adversarial Robustness for Audio-Visual Active Speaker Detection},
  author = {Xuanjun Chen and Haibin Wu and Helen Meng and Hung-yi Lee and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2210.00753},
  year   = {2022}
}

备注

Accepted by SLT 2022