TONet:用于从复调音乐中提取歌唱旋律的音级-八度网络
音频与语音处理
2022-02-03 v1 人工智能
机器学习
多媒体
声音
摘要
歌唱旋律提取是音乐信息检索领域的一个重要问题。现有方法通常依赖频域表示来估计演唱频率。然而,这种设计在音级(pitch-class)和八度的旋律信息感知上无法达到人类水平的表现。本文提出 TONet,一种即插即用模型,通过新颖的输入表示和新型网络架构来改善音级与八度感知。首先,我们提出一种改进的输入表示 Tone-CFP,它通过重排频率 bin 来显式地分组谐波。其次,我们引入一种编码器-解码器架构,旨在获得显著特征图、音级特征图和八度特征图。第三,我们提出一种音级-八度融合机制以改善最终的显著特征图。我们进行了实验,以验证 TONet 在各种基线骨干模型下的能力。结果表明,采用 Tone-CFP 的音级-八度融合能显著提升跨多个数据集的歌唱声提取性能——在八度和音级准确率上均有大幅增益。
引用
@article{arxiv.2202.00951,
title = {TONet: Tone-Octave Network for Singing Melody Extraction from Polyphonic Music},
author = {Ke Chen and Shuai Yu and Cheng-i Wang and Wei Li and Taylor Berg-Kirkpatrick and Shlomo Dubnov},
journal= {arXiv preprint arXiv:2202.00951},
year = {2022}
}
备注
Preprint Version for ICASSP 2022, Singapore