中文

跨模态序列数据中的无监督失配定位及其在错音定位中的应用

机器学习 2023-01-10 v3

摘要

当一种模态的数据被转换为另一种模态时,通常会发生内容失配,例如语言学习者在朗读句子(目标文本)时产生错音(语音中的错误)。然而,大多数现有对齐算法假设两种模态涉及的内容完全匹配,因而难以定位语音与文本之间的此类失配。本工作中,我们开发了一种无监督学习算法,能够推断内容失配的跨模态序列数据(尤其是语音-文本序列)之间的关系。更具体地,我们提出一种分层贝叶斯深度学习模型,称为失配定位变分自编码器(ML-VAE),其将语音的生成过程分解为分层结构的潜变量,以指示两种模态之间的关系。由于所涉及的具有复杂依赖关系的离散潜变量,训练此类模型极具挑战性。为应对该挑战,我们提出一种新颖且有效的训练流程,在专门设计的失配定位有限状态接收器(ML-FSA)上估计离散潜变量的硬分配与更新神经网络参数之间交替进行。本工作中,我们聚焦于语音与文本的失配定位问题,实验结果表明ML-VAE成功定位了文本与语音之间的失配,且无需人工标注用于模型训练。

关键词

引用

@article{arxiv.2205.02670,
  title  = {Unsupervised Mismatch Localization in Cross-Modal Sequential Data with Application to Mispronunciations Localization},
  author = {Wei Wei and Huang Hengguan and Gu Xiangming and Wang Hao and Wang Ye},
  journal= {arXiv preprint arXiv:2205.02670},
  year   = {2023}
}