中文

WaDeNet:基于小波分解的 CNN 语音处理模型

声音 2020-11-12 v1 机器学习

摘要

现有语音处理系统由不同模块组成,各自针对特定任务(如声学建模或特征提取)优化。除了无法保证系统最优性外,当前语音处理系统的离散特性也使其不适用于普适健康应用。我们提出 WaDeNet,一种用于移动语音处理的端到端模型。为融入频谱特征,WaDeNet 在架构中嵌入了语音信号的小波分解。这使得 WaDeNet 能够以端到端方式从频谱特征中学习,从而免除了当前语音处理系统中所需的特性提取及后续模块。WaDeNet 在涉及移动健康语音应用(如非侵入式情绪识别)的数据集上优于当前最优方法。与现有最优模型相比,WaDeNet 准确率平均提升 6.36%。此外,WaDeNet 比结构相似的简单 CNN 明显更轻量。

关键词

引用

@article{arxiv.2011.05594,
  title  = {WaDeNet: Wavelet Decomposition based CNN for Speech Processing},
  author = {Prithvi Suresh and Abhijith Ragav},
  journal= {arXiv preprint arXiv:2011.05594},
  year   = {2020}
}