中文

从个性化声学模型中检索说话人信息用于语音识别

计算与语言 2021-11-09 v1 声音 音频与语音处理

摘要

能够收集用户语音的强大个人设备的普及,为构建说话人自适应语音识别系统(ASR)或参与 ASR 协作学习提供了机会。在这两种情况下,都可以构建个性化声学模型(AM),即用特定说话人数据微调的 AM。一个自然产生的问题是,个性化声学模型的传播是否会泄露个人信息。在本文中,我们展示仅通过利用针对该说话人局部自适应的神经声学模型的权重矩阵变化,就有可能检索说话人的性别,乃至其身份。我们顺便观察到一些现象,可能对语音处理背景下深度神经网络的可解释性有用。性别几乎可以肯定地使用仅前几层来识别,而说话人验证在使用中上层时表现良好。我们在 TED-LIUM 3 数据集上使用 HMM/TDNN 模型的实验研究显示出 95% 的性别检测准确率,以及 9.07% 的等错误率用于说话人验证任务,仅利用可替代用户数据交换的个性化模型的权重。

关键词

引用

@article{arxiv.2111.04194,
  title  = {Retrieving Speaker Information from Personalized Acoustic Models for Speech Recognition},
  author = {Salima Mdhaffar and Jean-François Bonastre and Marc Tommasi and Natalia Tomashenko and Yannick Estève},
  journal= {arXiv preprint arXiv:2111.04194},
  year   = {2021}
}