用于人声分离和人声旋律转录的Mel-RoFormer
声音
2024-09-10 v1 音频与语音处理
摘要
开发一个通用的深度神经网络来建模音乐音频在MIR中至关重要。由于音乐信号中固有的复杂频谱变化(这些变化传达了不同乐器的旋律、和声和音色),这项任务具有挑战性。在本文中,我们介绍了Mel-RoFormer,一个基于频谱图的模型,具有两个关键设计:前端的一个新颖的Mel频带投影模块,以增强模型跨多个频带捕获信息特征的能力;以及交错排列的RoPE Transformer,以明确地将频率和时间维度建模为两个独立的序列。我们将Mel-RoFormer应用于解决两个基本的MIR任务:人声分离和人声旋律转录,分别旨在从音频混合中分离歌声并转录其主旋律。尽管这些任务都关注歌声信号,但它们具有不同的优化目标。我们没有训练一个统一的模型,而是采用两步方法。首先,我们训练一个人声分离模型,该模型随后作为基础模型,通过微调用于人声旋律转录。通过在基准数据集上进行的大量实验,我们展示了我们的模型在人声分离和旋律转录任务中均达到了最先进的性能,突显了Mel-RoFormer在建模复杂音乐音频信号方面的有效性和多功能性。
引用
@article{arxiv.2409.04702,
title = {Mel-RoFormer for Vocal Separation and Vocal Melody Transcription},
author = {Ju-Chiang Wang and Wei-Tsung Lu and Jitong Chen},
journal= {arXiv preprint arXiv:2409.04702},
year = {2024}
}
备注
Accepted to appear in ISMIR 2024