基于对比学习的多语言音频到歌词对齐
声音
2023-06-14 v1 机器学习
音频与语音处理
摘要
歌词对齐近年来受到相当多的关注。最先进的系统要么复用已建立的语音识别工具包,要么设计涉及连接主义时序分类(CTC)损失的端到端解决方案。然而,这两种方法都存在特定弱点:工具包以其复杂性而闻名,而 CTC 系统使用的为转录设计的损失可能限制对齐精度。在本文中,我们改用一种对比学习过程,其导出关联音频与文本域的跨模态嵌入。以此方式,我们获得了一个新颖的系统,其易于端到端训练,可利用弱标注训练数据,联合学习一个强大的文本模型,并且专为对齐而设计。该系统不仅是首个在标准 Jamendo 数据集上取得平均绝对误差低于 0.2 秒的系统,而且对其他语言也具有鲁棒性,即便仅在英语数据上训练。最后,我们发布了 JamendoLyrics Multi-Lang 数据集的词级对齐结果。
引用
@article{arxiv.2306.07744,
title = {Contrastive Learning-Based Audio to Lyrics Alignment for Multiple Languages},
author = {Simon Durand and Daniel Stoller and Sebastian Ewert},
journal= {arXiv preprint arXiv:2306.07744},
year = {2023}
}
备注
5 pages, accepted at the International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2023