中文

基于梯度退火和 SSL 声学特征的 VAE 语音素音对齐

音频与语音处理 2024-09-26 v2 声音

摘要

本文提出了一个用于语音分析和视频内容创建的准确语音素音对齐模型。我们提出了一种基于变分自编码器 (VAE) 的对齐模型,通过在无监督方式下搜索编码后的声学和语言嵌入来寻找可能的路径。我们提出的模型基于一种 TTS 对齐 (OTA) 方法,并扩展以获取语音素音边界。具体而言,我们采用 VAE 架构保持嵌入与输入之间的一致性,应用梯度退火以避免训练中的局部最优解,并引入基于自监督学习 (SSL) 的声学特征输入和状态级语言单元以利用丰富且细致的信息。实验结果表明,本文提出的模型生成的语音素音边界与标注的边界更接近,相较于传统的 OTA 模型、CTC 基于分段模型以及广泛使用的工具 MFA。

关键词

引用

@article{arxiv.2407.02749,
  title  = {VAE-based Phoneme Alignment Using Gradient Annealing and SSL Acoustic Features},
  author = {Tomoki Koriyama},
  journal= {arXiv preprint arXiv:2407.02749},
  year   = {2024}
}

备注

Proceedings of Interspeech 2024