用于歌声旋律提取的频时注意力网络
声音
2021-06-16 v1 音频与语音处理
摘要
音乐音频通常由频率、时间和幅度三个物理属性构成。有趣的是,人类听觉外周也为感知音乐的这三个维度提供了神经编码。受这些内在特性的启发,本文提出一种频时注意力网络来模拟人类听觉以进行歌声旋律提取。具体而言,所提模型包含对应于这三个物理属性的频时注意力模块和选择性融合模块。频率注意力模块用于选择如同耳蜗中相同的激活频带,时间注意力模块负责分析时间模式。最后,提出选择性融合模块来重新校准幅度并融合原始信息以进行预测。此外,我们提出使用另一分支同时预测歌声旋律的存在。实验结果表明,所提模型优于现有的最先进方法。
引用
@article{arxiv.2102.09763,
title = {Frequency-Temporal Attention Network for Singing Melody Extraction},
author = {Shuai Yu and Xiaoheng Sun and Yi Yu and Wei Li},
journal= {arXiv preprint arXiv:2102.09763},
year = {2021}
}
备注
This paper has been accepted by ICASSP 2021