中文

基于深度多项式网络的加密语音识别

密码学与安全 2019-05-15 v1 计算与语言 声音 音频与语音处理 机器学习

摘要

基于云的语音识别/API 为开发者或企业提供了一种在其应用中创建语音功能的简便方式。然而,将涉及个人或公司内部信息的音频发送至云端,引发了关于隐私与安全问题的担忧。云端生成的识别结果也可能泄露一些敏感信息。本文提出了一种深度多项式网络(DPN),可作为声学模型应用于加密语音。它允许客户端以加密形式将数据发送至云端,以确保其数据保持机密,同时 DPN 仍可在加密语音上进行帧级预测并以加密形式返回。DPN 的一个良好特性是它可以使用传统方式在未加密语音特征上训练。为使云端远离原始音频与识别结果,本文还提出了一种云-本地联合解码框架。我们在 Switchboard 和 Cortana 语音助手任务上展示了该模型与框架的有效性,相较于传统基于云的 DNN,性能下降较小且延迟有所增加。

关键词

引用

@article{arxiv.1905.05605,
  title  = {Encrypted Speech Recognition using Deep Polynomial Networks},
  author = {Shi-Xiong Zhang and Yifan Gong and Dong Yu},
  journal= {arXiv preprint arXiv:1905.05605},
  year   = {2019}
}

备注

ICASSP 2019, slides@ https://www.researchgate.net/publication/333005422_Encrypted_Speech_Recognition_using_deep_polynomial_networks