邻近核中时间上下文的重要性:一项人声分离案例研究
声音
2017-11-01 v2
摘要
音乐源分离方法利用源特定的频谱特性来促进分解过程。核加性建模(Kernel Additive Modelling, KAM)通过对由源特定核指定的时频单元应用稳健统计来建模源,该核是定义单元间相似度的函数。现有方法中的核通常使用单时间帧之间的度量来定义。然而,在噪声和其他声源存在的情况下,来自单帧的信息被证明是不可靠的,且常错误地选择帧作为相似。本文中,我们将时间上下文纳入核中,以提供稳定相似度搜索的额外信息。在人声分离背景下评估,我们的简单扩展相较于先前核带来了分离质量的显著提升。
引用
@article{arxiv.1702.02130,
title = {On the Importance of Temporal Context in Proximity Kernels: A Vocal Separation Case Study},
author = {Delia Fano Yela and Sebastian Ewert and Derry FitzGerald and Mark Sandler},
journal= {arXiv preprint arXiv:1702.02130},
year = {2017}
}
备注
2017 AES International Conference on Semantic Audio