用于语音-音乐分类的时频音频特征
音频与语音处理
2018-11-06 v1 声音
摘要
在语音和音乐的谱图中观察到明显的条纹模式。这促使我们提出三种用于语音-音乐分类的新颖时频特征。这些特征分两个阶段提取。首先,从每帧的频谱中确定预设数量的显著谱峰位置。从每帧获得的这些重要峰值位置用于形成音频区间的谱峰序列(SPS)。在第二阶段,这些 SPS 被视为频率位置的时间序列数据。所提出特征作为这些谱峰序列的周期性、平均频率和统计属性被提取。语音-音乐分类通过学习这些特征上的二分类器来执行。我们尝试了高斯混合模型、支持向量机和随机森林分类器。我们的方案在四个数据集上得到验证,并与三种基线方法进行了基准比较。实验结果确立了我们方案的有效性。
引用
@article{arxiv.1811.01222,
title = {Time-Frequency Audio Features for Speech-Music Classification},
author = {Mrinmoy Bhattacharjee and S. R. M. Prasanna and Prithwijit Guha},
journal= {arXiv preprint arXiv:1811.01222},
year = {2018}
}
备注
4 pages, 16 figures