中文

自回归与跨语言音素感知网络在无监督子词建模中的有效性

音频与语音处理 2021-06-08 v2 计算与语言 声音

摘要

本研究关注无监督子词建模,即学习能够区分一门语言中子词单元的声学特征表示。我们提出一种结合自监督学习与跨语言知识迁移的两阶段学习框架。该框架以前端自回归预测编码(APC)与后端跨语言深度神经网络(DNN)组成。在Libri-light与ZeroSpeech 2017数据库上进行的ABX子词可分辨性任务的实验表明,我们的方法具有竞争力或优于最先进研究。在音素与发音特征(AF)层面的全面系统分析显示,我们的方法在捕捉双元音而非单元音元音信息方面更好,同时也观察到所捕捉不同类别辅音信息量的差异。此外,发现后端捕捉音素信息的有效性与分配给该音素的跨语言音素标签质量之间存在正相关。AF层面分析结合t-SNE可视化结果显示,所提方法在捕捉发音方式、发音部位信息、元音高度与前后信息方面优于MFCC与APC特征。综上,分析表明我们方法中的两阶段在捕捉音素与AF信息上均有效。尽管如此,单元音元音信息的捕捉不如辅音信息,这提示未来研究应聚焦于改进单元音元音信息的捕捉。

关键词

引用

@article{arxiv.2012.09544,
  title  = {The effectiveness of unsupervised subword modeling with autoregressive and cross-lingual phone-aware networks},
  author = {Siyuan Feng and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2012.09544},
  year   = {2021}
}

备注

18 pages (including 1 page as supplementary material), 13 figures. Accepted for publication in IEEE Open Journal of Signal Processing (OJ-SP)