中文

面向波形信号的端到端可解释卷积神经网络

声音 2024-05-06 v1 人工智能 音频与语音处理

摘要

本文提出一种新型卷积神经网络(CNN)框架,专为端到端音频深度学习模型而设计,具有效率和可解释性方面的突破。通过在三个标准语音情感识别数据集上进行五折交叉验证基准实验,我们的框架在提升Mel频谱特征方面达到了最高七个百分点。它有望取代Mel频谱声谱系数(MFCC),同时保持轻量级。此外,我们在使用PhysioNet Heart Sound Database时,展示了前端层的效率和可解释性,说明其能够处理和捕获复杂的长波形模式。我们的贡献为构建处理原始波形数据的高效且可解释模型提供了可搬载的解决方案。

关键词

引用

@article{arxiv.2405.01815,
  title  = {Toward end-to-end interpretable convolutional neural networks for waveform signals},
  author = {Linh Vu and Thu Tran and Wern-Han Lim and Raphael Phan},
  journal= {arXiv preprint arXiv:2405.01815},
  year   = {2024}
}