一种用于生成鲁棒且不可感知音频对抗样本的综合算法
声音
2023-10-06 v1 机器学习
音频与语音处理
摘要
音频对抗样本是指经过篡改以欺骗自动语音识别(ASR)系统,同时对人耳听者而言仍显得正常的音频文件。大多数生成此类样本的方法基于两步算法:首先生成可行的对抗音频文件,然后针对可感知性与鲁棒性进行微调。本工作中,我们提出一种在生成步骤中利用心理声学模型与房间脉冲响应(RIR)的综合算法。RIR 由神经网络在生成过程中动态创建,以模拟物理环境,从而增强我们的样本抵御空中(over-the-air)攻击中所经历变换的能力。我们在三个实验中比较不同方法:在仿真环境中与真实空中场景下评估鲁棒性,并通过人类主观实验评估可感知性。我们的算法在仅考虑心理声学或同时考虑鲁棒性时,均以词错误率(WER)升高为代价,在信噪比(SNR)与人类感知实验中表现出改善。
引用
@article{arxiv.2310.03349,
title = {An Integrated Algorithm for Robust and Imperceptible Audio Adversarial Examples},
author = {Armin Ettenhofer and Jan-Philipp Schulze and Karla Pizzi},
journal= {arXiv preprint arXiv:2310.03349},
year = {2023}
}
备注
Proc. 3rd Symposium on Security and Privacy in Speech Communication