WaDeNet:基于小波分解的 CNN 语音处理模型
声音
2020-11-12 v1 机器学习
摘要
现有语音处理系统由不同模块组成,各自针对特定任务(如声学建模或特征提取)优化。除了无法保证系统最优性外,当前语音处理系统的离散特性也使其不适用于普适健康应用。我们提出 WaDeNet,一种用于移动语音处理的端到端模型。为融入频谱特征,WaDeNet 在架构中嵌入了语音信号的小波分解。这使得 WaDeNet 能够以端到端方式从频谱特征中学习,从而免除了当前语音处理系统中所需的特性提取及后续模块。WaDeNet 在涉及移动健康语音应用(如非侵入式情绪识别)的数据集上优于当前最优方法。与现有最优模型相比,WaDeNet 准确率平均提升 6.36%。此外,WaDeNet 比结构相似的简单 CNN 明显更轻量。
引用
@article{arxiv.2011.05594,
title = {WaDeNet: Wavelet Decomposition based CNN for Speech Processing},
author = {Prithvi Suresh and Abhijith Ragav},
journal= {arXiv preprint arXiv:2011.05594},
year = {2020}
}