中文

用于语音-音乐分类的时频音频特征

音频与语音处理 2018-11-06 v1 声音

摘要

在语音和音乐的谱图中观察到明显的条纹模式。这促使我们提出三种用于语音-音乐分类的新颖时频特征。这些特征分两个阶段提取。首先,从每帧的频谱中确定预设数量的显著谱峰位置。从每帧获得的这些重要峰值位置用于形成音频区间的谱峰序列(SPS)。在第二阶段,这些 SPS 被视为频率位置的时间序列数据。所提出特征作为这些谱峰序列的周期性、平均频率和统计属性被提取。语音-音乐分类通过学习这些特征上的二分类器来执行。我们尝试了高斯混合模型、支持向量机和随机森林分类器。我们的方案在四个数据集上得到验证,并与三种基线方法进行了基准比较。实验结果确立了我们方案的有效性。

关键词

引用

@article{arxiv.1811.01222,
  title  = {Time-Frequency Audio Features for Speech-Music Classification},
  author = {Mrinmoy Bhattacharjee and S. R. M. Prasanna and Prithwijit Guha},
  journal= {arXiv preprint arXiv:1811.01222},
  year   = {2018}
}

备注

4 pages, 16 figures