利用三阶段级联迭代优化无监督发现包含两级声学模式的语言结构
计算与语言
2015-09-09 v1
摘要
无监督声学模式发现技术正日益受到关注,因为海量语音数据不断可用而人工标注仍难以获取。本文提出一种给定原始语音数据后针对目标口语语言的无监督语言结构发现方法。该语言结构包括两级(类子词与类词)声学模式、以类子词模式表示的类词模式词典,以及基于类词模式的 N-gram 语言模型。所有模式、模型和参数均可从未经标注的语音语料库中自动学习。这通过初始化步骤以及随后用于声学、语言与词汇迭代优化的三个阶段级联实现。类词模式词典定义了类子词模式 HMM 的允许连续序列。在每次迭代中,模型训练与解码产生更新后的标签,词典和 HMM 可据此进一步更新。如此,模型参数与解码标签在每次迭代中分别被优化,关于语言结构的知识逐层渐次习得。所提方法在普通话广播新闻语料上进行了初步实验测试,包括口语术语检测任务,其性能与采用有监督训练模型的并行测试进行比较。结果表明,所提系统不仅自身取得合理性能,而且与现有大词汇量 ASR 系统互补。
引用
@article{arxiv.1509.02208,
title = {Unsupervised Discovery of Linguistic Structure Including Two-level Acoustic Patterns Using Three Cascaded Stages of Iterative Optimization},
author = {Cheng-Tao Chung and Chun-an Chan and Lin-shan Lee},
journal= {arXiv preprint arXiv:1509.02208},
year = {2015}
}
备注
Accepted by ICASSP 2013