歌声的频谱映射:U-Net辅助的人声分割
声音
2024-05-31 v1 人工智能
音频与语音处理
摘要
从音乐轨道中分离人声元素是音频信号处理中一个长期存在的挑战。本研究解决了从音乐频谱图中清晰分离人声成分的问题。我们采用短时傅里叶变换(STFT)将音频波提取为详细的频率-时间频谱图,利用基准MUSDB18数据集进行音乐分离。随后,我们实现了一个UNet神经网络来分割频谱图图像,旨在准确描绘和提取歌唱声音成分。我们使用基于U-Net的模型在音频源分离中取得了显著成果。频率轴归一化与最小/最大缩放以及平均绝对误差(MAE)损失函数的组合实现了最高的源失真比(SDR)7.1 dB,表明在分离过程中保持了原始信号质量的高精度。该设置还记录了令人印象深刻的源干扰比(SIR)和源伪影比(SAR)分数,分别为25.2 dB和7.2 dB。这些值显著优于其他配置,特别是使用分位数归一化或均方误差(MSE)损失函数的配置。我们的源代码、模型权重和演示材料可在项目的GitHub仓库中找到:https://github.com/mbrotos/SoundSeg
引用
@article{arxiv.2405.20059,
title = {Spectral Mapping of Singing Voices: U-Net-Assisted Vocal Segmentation},
author = {Adam Sorrenti},
journal= {arXiv preprint arXiv:2405.20059},
year = {2024}
}