中文

预训练语音模型的噪声掩码攻击与防御

机器学习 2024-04-03 v1

摘要

语音模型通常会在为提升模型性能而训练敏感数据,导致潜在的隐私泄露。我们的工作考虑噪声掩码攻击,由Amid 等人于2022年引入,这类攻击通过请求对部分被噪声替换的语音记录的转录来攻击自动语音识别(ASR)模型。他们指出,当记录在训练时曾被观察到时,模型会以其记忆中的敏感转录来转录该噪声记录。在我们的工作中,我们将这些攻击扩展到攻击预训练语音编码器。我们的 方法通过微调编码器以产生ASR 模型,然后对该模型执行噪声掩码,我们发现尽管该模型在预训练期间从未看到转录,却能从预训练数据中恢复私人信息!我们展示了如何提高这些攻击的精度,并调查了多种对抗措施。

关键词

引用

@article{arxiv.2404.02052,
  title  = {Noise Masking Attacks and Defenses for Pretrained Speech Models},
  author = {Matthew Jagielski and Om Thakkar and Lun Wang},
  journal= {arXiv preprint arXiv:2404.02052},
  year   = {2024}
}

备注

accepted to ICASSP 2024