中文

面向提升谐波敏感度与预测稳定性的歌声旋律提取

声音 2023-08-08 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

在深度学习研究中,许多旋律提取模型依赖重新设计神经网络架构以提升性能。本文中,我们基于两个假设提出了一种输入特征修改与一种训练目标修改。首先,音频数据谱图中的谐波沿频率轴快速衰减。为增强模型对尾部谐波的敏感度,我们使用离散 z 变换修改组合频率与周期性(CFP)表示。其次,极短时长的人声与非人声段不常见。为保障更稳定的旋律轮廓,我们设计了一个可微损失函数以防止模型预测此类片段。我们将这些修改应用于若干模型,包括 MSNet、FTANet 以及一个由钢琴转录网络修改而来的新引入模型 PianoNet。我们的实验结果表明所提修改对歌声旋律提取具有实证有效性。

关键词

引用

@article{arxiv.2308.02723,
  title  = {Towards Improving Harmonic Sensitivity and Prediction Stability for Singing Melody Extraction},
  author = {Keren Shao and Ke Chen and Taylor Berg-Kirkpatrick and Shlomo Dubnov},
  journal= {arXiv preprint arXiv:2308.02723},
  year   = {2023}
}

备注

7 pages, 4 figures, 2 tables, Proceedings of the 24th International Society for Music Information Retrieval Conference, ISMIR 2023