从 ASR 模型中提取目标训练数据及其缓解方法
声音
2022-06-29 v2 密码学与安全
机器学习
音频与语音处理
摘要
近期工作设计了若干方法,表明 ASR 训练中的模型更新可能泄露用于计算更新的语音中潜在的敏感属性。在本工作中,我们设计了首个方法来证明从训练好的 ASR 模型中泄露训练数据信息。我们设计了 Noise Masking,一种从训练好的 ASR 模型中提取训练数据特定部分的填空式方法。我们通过在四种设定下使用该方法从用于训练最先进 Conformer 模型的 LibriSpeech 数据集中提取姓名,证明了 Noise Masking 的成功。特别地,我们展示能够以 11.8% 的准确率从掩码训练语音中正确提取姓名,而模型在 55.2% 的情况下会输出训练集中的某个姓名。此外,我们表明即使在使用了合成音频和来自测试集的部分转录文本的设定下,我们的方法仍能达到 2.5% 的正确姓名准确率(47.7% 任意姓名成功率)。最后,我们设计了 Word Dropout,一种数据增强方法,表明在训练中与 Multistyle TRaining(MTR)一同使用时,其效用与基线相当,并显著缓解了在四种评估设定下通过 Noise Masking 进行提取的情况。
引用
@article{arxiv.2204.08345,
title = {Extracting Targeted Training Data from ASR Models, and How to Mitigate It},
author = {Ehsan Amid and Om Thakkar and Arun Narayanan and Rajiv Mathews and Françoise Beaufays},
journal= {arXiv preprint arXiv:2204.08345},
year = {2022}
}
备注
Accepted to appear at Interspeech'22