TIPAA-SSL: 基于自监督学习与知识迁移的文本无关音素-音频对齐
音频与语音处理
2024-05-06 v1 人工智能
计算与语言
机器学习
摘要
本文提出了一种基于音素识别、表示学习和知识迁移的文本无关音素-音频对齐新方法。我们的方法利用一个经连接时序分类损失微调用于音素识别的自监督模型(wav2vec2)、一个降维模型以及一个借助强制对齐标签(使用蒙特利尔强制对齐器)训练的帧级音素分类器来产生多语言语音表示,从而只需极少的额外训练。我们分别使用来自 TIMIT 数据集和 SCRIBE 数据集的合成母语数据,对美式英语和英式英语进行了模型评估。我们提出的模型在统计指标上优于当前最优模型(charsiu),并在语言学习和语音处理系统中具有应用前景。我们将其他语言的实验留作未来工作,但该系统的设计使其易于适应其他语言。
引用
@article{arxiv.2405.02124,
title = {TIPAA-SSL: Text Independent Phone-to-Audio Alignment based on Self-Supervised Learning and Knowledge Transfer},
author = {Noé Tits and Prernna Bhatnagar and Thierry Dutoit},
journal= {arXiv preprint arXiv:2405.02124},
year = {2024}
}