Self-Transcriber:基于自训练的少样本歌词转写
音频与语音处理
2023-03-03 v2 声音
摘要
当前的歌词转写方法严重依赖带标注数据的监督学习,但此类数据稀缺且人工标注演唱代价高昂。如何利用无标注数据并缓解数据有限的问题在歌词转写中尚未被探索。我们提出了首个半监督歌词转写范式 Self-Transcriber,通过采用带噪声学生增强的自训练来利用无标注数据。我们试图证明仅使用少量标注数据进行歌词转写的可能性。Self-Transcriber 使用教师模型生成无标注演唱的伪标签,并将伪标签扩充到标注数据中,通过自训练损失和监督训练损失来更新学生模型。本工作缩小了监督学习与半监督学习之间的差距,并为歌词转写的少样本学习打开了大门。我们的实验表明,我们的方法仅使用 12.7 小时标注数据,在与使用 149.1 小时标注数据训练的监督方法相比时取得了具有竞争力的歌词转写性能。
引用
@article{arxiv.2211.10152,
title = {Self-Transriber: Few-shot Lyrics Transcription with Self-training},
author = {Xiaoxue Gao and Xianghu Yue and Haizhou Li},
journal= {arXiv preprint arXiv:2211.10152},
year = {2023}
}
备注
Accepted by ICASSP 2023