中文

基于音频信号谱图深度学习的多类语言识别

声音 2019-05-14 v1 机器学习 音频与语音处理

摘要

任何语音识别软件的第一步都是确定说话者使用的语言,理想情况下该过程应是自动化的。本文描述的技术,即音频谱图语言识别(LIFAS),使用由音频信号生成的谱图作为卷积神经网络(CNN)的输入以用于语言识别。LIFAS对音频信号仅需极少的预处理,因为谱图在训练时作为每批输入网络的过程中生成。LIFAS利用在图像处理任务中已被证明成功的深度学习工具,并将其应用于音频信号分类。LIFAS在3.75秒音频片段上以97%的准确率执行二分类语言识别,并以89%的准确率对六种语言进行多类分类。

关键词

引用

@article{arxiv.1905.04348,
  title  = {Multiclass Language Identification using Deep Learning on Spectral Images of Audio Signals},
  author = {Shauna Revay and Matthew Teschke},
  journal= {arXiv preprint arXiv:1905.04348},
  year   = {2019}
}