中文

用于从连续语音信号直接习得语言的非参数贝叶斯双发音分析器

人工智能 2023-01-18 v2 计算与语言 机器学习 机器学习

摘要

人类婴儿无需任何显式标注数据即可从未分段的语音信号中直接发现单词。本文中,我们开发了一种称为非参数贝叶斯双发音分析器(NPB-DAA)的新颖机器学习方法,可直接从观测到的连续语音信号中获取语言和声学模型。为此,我们提出了一个集成生成模型,将语言模型和声学模型组合成单一生成模型,称为“层次狄利克雷过程隐语言模型”(HDP-HLM)。HDP-HLM通过扩展Johnson等人提出的层次狄利克雷过程隐半马尔可夫模型(HDP-HSMM)得到。利用最初为HDP-HSMM提出的块吉布斯采样器,推导了HDP-HLM的推断过程。该过程使得从连续语音信号中同时直接推断语言和声学模型成为可能。基于HDP-HLM及其推断过程,我们开发了一种新颖的双发音分析器。通过假设HDP-HLM为观测时间序列数据的生成模型,并推断模型的潜变量,该方法能以无监督方式分析数据的潜双发音结构,即分层组织的潜单词和音素。该新颖的无监督双发音分析器称为NPB-DAA。NPB-DAA能自动估计嵌入语音信号中的双发音结构。我们还使用合成数据以及表示日语元音序列的实际人类连续语音信号进行了两项评估实验。在单词习得和音素分类任务中,NPB-DAA优于传统的双发音分析器(DAA)以及声学模型以有监督方式训练的基线自动语音识别系统。

关键词

引用

@article{arxiv.1506.06646,
  title  = {Nonparametric Bayesian Double Articulation Analyzer for Direct Language Acquisition from Continuous Speech Signals},
  author = {Tadahiro Taniguchi and Ryo Nakashima and Shogo Nagasaka},
  journal= {arXiv preprint arXiv:1506.06646},
  year   = {2023}
}

备注

15 pages, 7 figures, Draft submitted to IEEE Transactions on Autonomous Mental Development (TAMD)