中文

SoK:一种用于研究自动语音识别系统安全性的模块化方法

密码学与安全 2021-08-02 v2 机器学习 声音 音频与语音处理

摘要

随着自动语音识别(ASR)在人机交互、同声传译、音频转录等应用中的广泛使用,其安全保护变得日益重要。尽管近期研究已揭示流行 ASR 系统的弱点,这些弱点可引发带外信号攻击、对抗攻击等,并进一步提出了各种补救措施(信号平滑、对抗训练等),但对 ASR 安全性(包括攻击与防御)的系统性理解仍然缺失,尤其是关于此类威胁的现实性以及现有保护的通用性。在本文中,我们提出了 ASR 安全性的知识系统化(SoK),并基于模块化工作流为现有工作提供了全面分类。更重要的是,我们将该领域的研究与图像识别系统(IRS)中已被广泛研究的安全性研究相对齐,利用后者的领域知识来帮助理解前者所处的位置。一般而言,IRS 和 ASR 均为感知系统。它们的相似性使我们能够基于为 IRS 提出的攻击与防御方案谱系,系统性地研究 ASR 安全性的现有文献,并指出更先进攻击的方向以及可能在 ASR 中导致更有效保护的方向。相反,它们的差异,尤其是 ASR 相较 IRS 的复杂性,帮助我们认识 ASR 安全性中独特的挑战与机遇。特别地,我们的实验研究表明,跨 ASR 模型的迁移学习是可行的,即使在缺乏模型(甚至其类型)和训练数据知识的情况下亦然。

关键词

引用

@article{arxiv.2103.10651,
  title  = {SoK: A Modularized Approach to Study the Security of Automatic Speech Recognition Systems},
  author = {Yuxuan Chen and Jiangshan Zhang and Xuejing Yuan and Shengzhi Zhang and Kai Chen and Xiaofeng Wang and Shanqing Guo},
  journal= {arXiv preprint arXiv:2103.10651},
  year   = {2021}
}

备注

17 pages