基于Mamba网络的半监督演唱旋律提取:置信二元正则化
声音
2025-05-14 v1 人工智能
音频与语音处理
摘要
演唱旋律提取(SME)是音乐信息检索领域的关键任务。然而,现有方法面临多个局限性:首先,先前模型使用Transformer捕获上下文依赖关系,这需要二次计算,在推理阶段效率低。其次,先前工作通常依赖频率监督方法估计基频(f0),忽略了音乐演奏实际基于音符。最后,Transformer通常需要大量标记数据才能实现最佳性能,但SME任务缺乏足够的标注数据。为解决这些问题,本文提出一种基于Mamba的网络,称为SpectMamba,用于置信二元正则化的半监督演唱旋律提取。具体而言,我们引入视觉Mamba实现计算线性复杂度。然后,我们提出一种新型的音符-f0解码器,使模型更好地模拟音乐演奏。进一步,为缓解标注数据稀缺问题,引入置信二元正则化(CBR)模块,通过最大化正确类别的概率来利用未标记数据。该方法在多个公开数据集上进行评估,实验结果表明我们提出的方法有效。
引用
@article{arxiv.2505.08681,
title = {A Mamba-based Network for Semi-supervised Singing Melody Extraction Using Confidence Binary Regularization},
author = {Xiaoliang He and Kangjie Dong and Jingkai Cao and Shuai Yu and Wei Li and Yi Yu},
journal= {arXiv preprint arXiv:2505.08681},
year = {2025}
}