低资源条件下基于离散语音单元的无监督词分割
计算与语言
2022-05-19 v2 声音
音频与语音处理
摘要
语言记录有助于防止濒危方言的消亡,其中许多方言预计将在本世纪末消失。在记录口语语言时,从语音中进行无监督词分割(UWS)是一项有用但具挑战性的任务。其目标是生成时间戳,将话语切分为对应词的较小片段,可基于音素转写进行,或在缺乏转写时基于无监督语音离散化模型的输出进行。这些离散化模型仅使用原始语音训练,产生可应用于下游(基于文本的)任务的离散语音单元。本文中,我们比较了五类此类模型:三种贝叶斯方法与两种神经方法,关于其所产生单元对 UWS 的可利用性。对于 UWS 任务,我们使用两种模型进行实验,以 Mboshi(班图语 C25,一种来自刚果布拉柴维尔的无文字语言)为目标语言。此外,我们在同等低资源设置下报告了芬兰语、匈牙利语、罗马尼亚语和俄语的结果,仅使用 4 小时语音。我们的结果表明,用于语音离散化的神经模型在我们的设置中难以利用,可能有必要对其进行调整以限制序列长度。我们通过使用产生高质量但压缩的输入语音信号离散表示的贝叶斯模型获得了最佳 UWS 结果。
引用
@article{arxiv.2106.04298,
title = {Unsupervised Word Segmentation from Discrete Speech Units in Low-Resource Settings},
author = {Marcely Zanon Boito and Bolaji Yusuf and Lucas Ondel and Aline Villavicencio and Laurent Besacier},
journal= {arXiv preprint arXiv:2106.04298},
year = {2022}
}
备注
Accepted to SIGUL 2022