基于预训练语音模型的中文歌词转写与对齐自适应方法
音频与语音处理
2023-11-22 v1 声音
摘要
自动歌词转写与歌词对齐任务在过去几年中取得了显著的性能提升。然而,以往大多数工作仅关注于有大规模数据集可用的英语。在本文中,我们解决了低资源场景下复调中文流行音乐的歌词转写与对齐问题。为应对数据稀缺问题,我们对预训练的 Whisper 模型进行自适应,并在单声部中文歌唱数据集上对其进行微调。通过使用数据增强与源分离模型,结果表明,所提方法在中文复调数据集上的歌词转写字符错误率低于 18%,歌词对齐平均绝对误差为 0.071 秒。我们的结果展示了在低资源场景下自适应预训练语音模型用于歌词转写与对齐的潜力。
引用
@article{arxiv.2311.12488,
title = {Adapting pretrained speech model for Mandarin lyrics transcription and alignment},
author = {Jun-You Wang and Chon-In Leong and Yu-Chen Lin and Li Su and Jyh-Shing Roger Jang},
journal= {arXiv preprint arXiv:2311.12488},
year = {2023}
}
备注
Accepted by ASRU 2023