最优谱传输及其在音乐转谱中的应用
机器学习
2016-10-11 v2 机器学习
声音
摘要
许多光谱解混方法依赖于将光谱数据非负分解到光谱模板字典上。特别是,最先进的音乐转谱系统将输入信号的频谱图分解到具有代表性的音符频谱字典上。用于量化分解适应度的典型度量是逐频率地比较数据和模板条目。因此,能量从一个频率仓到另一个频率仓的微小位移以及音色的变化可能会对适应度造成不成比例的损害。我们通过最优传输解决这些问题,并提出了一种新的适应度度量,该度量将能量的频率分布作为整体处理,而非逐频率处理。基于声音的谐波特性,这种新度量对于能量向谐波相关频率的偏移以及能量的小范围局部位移具有不变性。在这种新适应度度量的支持下,音符模板字典可以大大简化为位于目标基频(音高值)处的一组 Dirac 向量。这反过来为一种非常快速且简单的分解算法奠定了基础,该算法在真实音乐数据上实现了 SOTA 的性能。
引用
@article{arxiv.1609.09799,
title = {Optimal spectral transportation with application to music transcription},
author = {Rémi Flamary and Cédric Févotte and Nicolas Courty and Valentin Emiya},
journal= {arXiv preprint arXiv:1609.09799},
year = {2016}
}
备注
NIPS 2016