基于元音声学重复模式无监督发现的歌词-音频对齐
声音
2020-10-29 v2 人工智能
信息检索
机器学习
音频与语音处理
摘要
大多数先前的歌词到音频对齐方法使用了预先开发的自动语音识别(ASR)系统,该系统天生存在将语音模型适应个别歌手的若干困难。先前工作中缺失的一个重要方面是歌唱声音中重复元音模式的自学习能力,其中使用的元音部分比辅音部分更一致。基于此,我们的系统首先通过学习标准声学特征的自相似性作为输入,基于加权对称非负矩阵分解(WS-NMF)学习元音序列的判别子空间。然后,我们利用源自近期计算机视觉技术的典型时间扭曲(CTW)来寻找文本与声学序列之间的最优时空变换。使用韩语和英语数据集的实验表明,在预先开发的无监督歌唱源分离之后部署该方法,比其他最先进的无监督方法和现有的基于ASR的系统取得了更有前景的结果。
引用
@article{arxiv.1701.06078,
title = {Lyrics-to-Audio Alignment by Unsupervised Discovery of Repetitive Patterns in Vowel Acoustics},
author = {Sungkyun Chang and Kyogu Lee},
journal= {arXiv preprint arXiv:1701.06078},
year = {2020}
}
备注
13 pages