中文

利用语言无关的子词判别特征表示实现无监督声学单元发现

音频与语音处理 2021-06-08 v2 计算与语言 声音

摘要

本文致力于从无标注语音数据中自动发现类音素声学单元(AUD)。以往研究通常提出单步方法。我们提出一种两阶段方法:第一阶段学习子词判别特征表示,第二阶段对所学表示进行聚类并得到类音素簇作为发现的声学单元。在第一阶段,通过以多语言OutOf-Domain(OOD)ASR系统替换单语言OOD ASR系统,改进了无监督子词建模任务中近期提出的一种方法,从而创建更具语言无关性的子词判别表示。在第二阶段,采用片段级k-means,并比较了将变长语音片段表示为定维特征向量的两种方法。在极低资源Mboshi语言语料上的实验表明,我们的方法在归一化互信息(NMI)和F值上均优于最先进的AUD。多语言ASR在提供OOD音素标注和估计音素边界方面均优于单语言ASR。在已知与未知真实音素边界的系统对比中显示出16%的NMI性能差距,表明当前方法可显著受益于改进的音素边界估计。

关键词

引用

@article{arxiv.2104.00994,
  title  = {Unsupervised Acoustic Unit Discovery by Leveraging a Language-Independent Subword Discriminative Feature Representation},
  author = {Siyuan Feng and Piotr Żelasko and Laureano Moro-Velázquez and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2104.00994},
  year   = {2021}
}

备注

Accepted for publication in INTERSPEECH 2021