PLCA 模型的粒子滤波及其在音乐转录中的应用
机器学习
2017-04-07 v1 机器学习
声音
摘要
自动音乐转录(AMT)旨在通过起始时间、持续时间和音高三个属性自动估计录音中的音符。概率潜在成分分析(PLCA)在此任务中变得非常流行。PLCA 是一种频谱图分解方法,能够将幅度频谱图建模为字典中频谱向量的线性组合。此类方法使用期望最大化(EM)算法来估计声学模型的参数。该算法存在众所周知的固有缺陷(局部收敛、依赖初始化),使得基于 EM 的系统在 AMT 中的应用受到限制,特别是在先验的数学形式和数量方面。为了克服这些限制,我们在本文中提出采用基于粒子滤波(PF)的不同估计框架,该框架包括在更大的参数范围内对后验分布进行采样。事实证明,该框架在参数估计方面更鲁棒,在将先验知识集成到系统方面更灵活且更具统一性。在包括古典钢琴(来自 MAPS 数据集)和 marovany 筝在内的两个不同乐器曲目的评估声音数据集上,音符级别的转录准确率分别达到了 61.8% 和 59.5%,并提供了与先前基于 PLCA 的方法的直接比较。此外还概述了进一步发展的步骤。
引用
@article{arxiv.1703.09772,
title = {Particle Filtering for PLCA model with Application to Music Transcription},
author = {D. Cazau and G. Revillon and W. Yuancheng and O. Adam},
journal= {arXiv preprint arXiv:1703.09772},
year = {2017}
}