基于量子卷积神经网络去中心化特征提取的自动语音识别
声音
2021-10-11 v2 机器学习
神经与进化计算
音频与语音处理
量子物理
摘要
我们提出了一种联邦学习中的新型去中心化特征提取方法,以解决语音识别中的隐私保护问题。该方法构建于量子卷积神经网络(QCNN)之上,QCNN 由用于特征提取的量子电路编码器和基于循环神经网络(RNN)的端到端声学模型(AM)组成。为增强去中心化架构中的模型参数保护,输入语音首先被上传至量子计算服务器以提取梅尔频谱图,随后使用带随机参数的量子电路算法对相应卷积特征进行编码。编码后的特征再下传至本地 RNN 模型进行最终识别。所提出的去中心化框架利用量子学习过程来保护模型并避免隐私泄露攻击。在 Google Speech Commands Dataset 上的测试表明,所提出的 QCNN 编码器在去中心化模型中达到了 95.12% 的竞争性准确率,优于此前使用带卷积特征的集中式 RNN 模型的架构。我们还对不同量子电路编码器架构进行了深入研究,以期为基于 QCNN 的特征提取器设计提供见解。神经显著性分析证明了所提出的 QCNN 特征、类别激活图和输入频谱图之间的相关性。我们提供了供未来研究使用的实现代码。
引用
@article{arxiv.2010.13309,
title = {Decentralizing Feature Extraction with Quantum Convolutional Neural Network for Automatic Speech Recognition},
author = {Chao-Han Huck Yang and Jun Qi and Samuel Yen-Chi Chen and Pin-Yu Chen and Sabato Marco Siniscalchi and Xiaoli Ma and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2010.13309},
year = {2021}
}
备注
Accepted to IEEE ICASSP 2021. Code is available: https://github.com/huckiyang/QuantumSpeech-QCNN