比特表示波形的音频分类
音频与语音处理
2019-09-19 v2 计算与语言
机器学习
声音
摘要
本研究探讨了用于音频信号分类的波形表示方法。近来,关于音频波形分类(如声学事件检测和音乐流派分类)的研究已有很多发表。大多数音频波形分类研究提出使用深度学习(神经网络)框架。通常,在将原始音频波形输入神经网络之前,会先应用傅里叶变换等频率分析方法从输入音频波形中提取频率或频谱信息。与这些先前研究不同,本文提出了一种新颖的波形表示方法,将音频波形表示为比特序列,用于音频分类。在我们的实验中,我们比较了直接输入神经网络的所提比特表示波形与其他音频波形表示(如原始音频波形和功率谱),在两个分类任务上:一个是声学事件分类任务,另一个是声音/音乐分类任务。实验结果表明,比特表示波形在两个任务上均取得了最佳的分类性能。
引用
@article{arxiv.1904.04364,
title = {Audio Classification of Bit-Representation Waveform},
author = {Masaki Okawa and Takuya Saito and Naoki Sawada and Hiromitsu Nishizaki},
journal= {arXiv preprint arXiv:1904.04364},
year = {2019}
}
备注
Accepted at INTERSPEECH2019