基于孪生与三元组网络对假设语音段重新聚类的无监督口语术语发现
音频与语音处理
2021-06-04 v2 计算与语言
声音
摘要
从未转写语音音频中发现口语术语可通过两阶段过程实现。第一阶段,将无标注语音解码为以无监督方式学习并建模的子词单元序列。第二阶段,对解码后的子词序列进行部分序列匹配与聚类,得到一组发现的词或短语。该方法的一个局限在于子词解码结果可能有误,且错误会影响后续步骤。尽管孪生/三元组网络是学习段表示从而改进发现过程的一种途径,但在完全无监督场景下进行口语术语发现的挑战在于缺乏训练样本。本文提出从初始假设序列聚类生成训练样本。孪生/三元组网络在这些假设样本上训练,以度量两段语音间的相似度,并据此对所有假设子词序列重新聚类,从而实现口语术语发现。实验结果表明,所提方法能有效获取孪生与三元组网络的训练样本,相较原始两阶段方法提升了口语术语发现的效果。
引用
@article{arxiv.2011.14062,
title = {Unsupervised Spoken Term Discovery Based on Re-clustering of Hypothesized Speech Segments with Siamese and Triplet Networks},
author = {Man-Ling Sung and Tan Lee},
journal= {arXiv preprint arXiv:2011.14062},
year = {2021}
}