中文

基于双发音分析器与带参数偏置神经网络的多说话人无监督音素与词发现

音频与语音处理 2023-01-18 v1 声音

摘要

本文描述了一种从多说话人同时发现音素和词的新无监督机器学习方法。人类婴儿能够从与母亲及周围他人的互动中获得音素和词的知识。从计算角度看,多说话人的音素与词发现比单说话人更具挑战性,因为不同说话人的语音信号表现出不同的声学特征。本文提出一种无监督音素与词发现方法,同时利用非参数贝叶斯双发音分析器(NPB-DAA)和带隐层参数偏置的深度稀疏自编码器(DSAE-PBHL)。我们假设婴儿能够基于某些其他特征(例如视觉人脸识别)来识别和区分说话人。DSAE-PBHL旨在能够减去说话人相关的声学特征并提取说话人无关的特征。实验表明,DSAE-PBHL能够减去声学信号的分布式表示,从而实现基于音素类型而非说话人的提取。另一实验表明,NPB-DAA与DSAE-PB的结合在多说话人日语音素序列语音信号的音素与词发现任务中优于现有方法。

关键词

引用

@article{arxiv.1906.11049,
  title  = {Unsupervised Phoneme and Word Discovery from Multiple Speakers using Double Articulation Analyzer and Neural Network with Parametric Bias},
  author = {Ryo Nakashima and Ryo Ozaki and Tadahiro Taniguchi},
  journal= {arXiv preprint arXiv:1906.11049},
  year   = {2023}
}

备注

21 pages. Submitted