教师-学生框架中从帧级到音符级的伪标签迁移用于复调音乐歌声转录
音频与语音处理
2022-03-31 v2 声音
摘要
缺乏大规模音符级标注数据是复调音乐歌声转录的主要障碍。我们通过使用来自音高估计模型在未标注数据上生成的伪标签来解决这一问题。所提方法首先通过音高和节奏量化步骤将帧级伪标签转换为音符级。然后,通过教师-学生框架中的自训练进一步提高标签质量。为验证该方法,我们通过考察两种音高估计模型作为伪标签生成器、两种教师-学生框架设置以及自训练中的迭代次数,进行了多种实验设置。结果表明,所提方法能有效利用大规模未标注音频数据,且使用噪声学生模型的自训练有助于提升性能。最后,我们表明仅用未标注数据训练的模型具有与先前工作相当的性能,而用额外标注数据训练的模型比仅用标注数据训练的模型取得了更高的准确率。
引用
@article{arxiv.2203.13422,
title = {Pseudo-Label Transfer from Frame-Level to Note-Level in a Teacher-Student Framework for Singing Transcription from Polyphonic Music},
author = {Sangeun Kum and Jongpil Lee and Keunhyoung Luke Kim and Taehyoung Kim and Juhan Nam},
journal= {arXiv preprint arXiv:2203.13422},
year = {2022}
}
备注
Accepted for publication at the 45th International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2022)