中文

利用预训练自监督前端进行自动歌声理解任务:三个案例研究

声音 2023-09-06 v2 机器学习 音频与语音处理

摘要

自动歌声理解任务,如歌手识别、歌声转写和演唱技巧分类,受益于利用深度学习技术的数据驱动方法。这些方法即使在丰富多样的声乐与噪声样本下也因其表征能力而表现良好。然而,标注数据的有限可用性仍是取得满意性能的重大障碍。近年来,自监督学习模型(SSL 模型)已在语音处理和音乐分类领域使用大量无标注数据进行训练。通过将这些模型微调至目标任务,可在有限训练数据下取得与传统监督学习相当的性能。因此,本文中我们研究了 SSL 模型在各种歌声识别任务中的有效性。我们报告了针对三个不同任务(即歌手识别、歌声转写和演唱技巧分类)比较 SSL 模型的实验结果,作为初步探索并旨在讨论这些发现。实验结果表明,每个 SSL 模型均取得了可比性能,且有时优于各任务上的最先进方法。我们还进行了逐层分析以进一步理解 SSL 模型的行为。

关键词

引用

@article{arxiv.2306.12714,
  title  = {Toward Leveraging Pre-Trained Self-Supervised Frontends for Automatic Singing Voice Understanding Tasks: Three Case Studies},
  author = {Yuya Yamamoto},
  journal= {arXiv preprint arXiv:2306.12714},
  year   = {2023}
}

备注

Accepted at APSIPA ASC 2023