中文

基于多带调制特征的乐音与人声分离

声音 2014-06-11 v1 人工智能

摘要

尽管 Mel 频率倒谱系数(MFCC)和音高等其他常用语音特征已被广泛用于音乐分析,但非线性语音特征的潜在应用尚未得到充分研究。本文假设音频信号为调制正弦波之和,并利用能量分离算法,通过非线性 Teager-Kaiser 能量算子将音频分解为幅度调制和频率调制分量。我们首先识别了音频信号中纯音乐段和纯语音段在这些非线性特征于不同 Mel 间隔频带上的分布,并展示了其判别能力。所提出的基于 Kullback-Leibler 散度度量的方法使用来自三位不同艺术家的印度古典歌曲集进行了评估。实验结果表明,在某些低频和中频频带(200 - 1500 Hz)中,这种判别能力尤为显著。

关键词

引用

@article{arxiv.1406.2464,
  title  = {Music and Vocal Separation Using Multi-Band Modulation Based Features},
  author = {Sunil Kumar Kopparapu and Meghna Pandharipande and G Sita},
  journal= {arXiv preprint arXiv:1406.2464},
  year   = {2014}
}

备注

5 pages, 5 figures, 2010 IEEE Symposium on Industrial Electronics Applications (ISIEA)