对抗语音攻击中语音学对说话人身份的影响
声音
2026-02-02 v2 人工智能
密码学与安全
音频与语音处理
摘要
语音中的对抗扰动对自动语音识别(ASR)和说话人验证构成严重威胁,通过引入对人类不可察觉但能显著改变系统输出的细微波形修改。虽然针对端到端ASR模型的定向攻击已被广泛研究,但这些扰动的语音学基础及其对说话人身份的影响仍未被充分探索。在本工作中,我们在语音学层面分析对抗音频,展示扰动利用了系统性混淆,如元音中心化和辅音替换。这些失真不仅误导转录,还损害说话人验证所需的关键语音线索,导致身份漂移。以DeepSpeech为我们的ASR目标,我们生成定向对抗样本,并评估其对真实样本和冒充样本中说话人嵌入的影响。跨越16个语音学多样化的目标短语的结果表明,对抗音频同时引发转录错误和身份漂移,强调了需要语音学感知的防御措施以确保ASR和说话人识别系统的鲁棒性。
引用
@article{arxiv.2509.15437,
title = {Impact of Phonetics on Speaker Identity in Adversarial Voice Attack},
author = {Daniyal Kabir Dar and Qiben Yan and Li Xiao and Arun Ross},
journal= {arXiv preprint arXiv:2509.15437},
year = {2026}
}
备注
Additional figures for extended visualization: https://daniyalkabir.github.io/icassp-2026-results/