中文

邻近核中时间上下文的重要性:一项人声分离案例研究

声音 2017-11-01 v2

摘要

音乐源分离方法利用源特定的频谱特性来促进分解过程。核加性建模(Kernel Additive Modelling, KAM)通过对由源特定核指定的时频单元应用稳健统计来建模源,该核是定义单元间相似度的函数。现有方法中的核通常使用单时间帧之间的度量来定义。然而,在噪声和其他声源存在的情况下,来自单帧的信息被证明是不可靠的,且常错误地选择帧作为相似。本文中,我们将时间上下文纳入核中,以提供稳定相似度搜索的额外信息。在人声分离背景下评估,我们的简单扩展相较于先前核带来了分离质量的显著提升。

关键词

引用

@article{arxiv.1702.02130,
  title  = {On the Importance of Temporal Context in Proximity Kernels: A Vocal Separation Case Study},
  author = {Delia Fano Yela and Sebastian Ewert and Derry FitzGerald and Mark Sandler},
  journal= {arXiv preprint arXiv:1702.02130},
  year   = {2017}
}

备注

2017 AES International Conference on Semantic Audio