基于多层级声学模式及可变模型粒度的无监督口语查询术语检测
计算与语言
2015-09-09 v1
摘要
本文提出一种使用从目标语料自动发现的多种声学模式集进行带口语查询的无监督口语术语检测新方法。不同的模式 HMM 配置(每模型状态数、不同模型数、每状态高斯数)构成一个三维模型粒度空间。在该三维空间上适当分布的不同点自动发现的不同声学模式集彼此互补,从而可联合捕捉口语术语的特征。通过将口语内容与口语查询表示为声学模式序列,开发了一系列在考虑信号变化的同时匹配模式索引序列的方法。如此,不仅在线计算负载得以降低,而且由不同说话人与声学条件引起的信号分布也能被合理照顾。结果表明,在 TIMIT 语料上,该方法在平均精度均值上比无监督基于特征的 DTW 基线显著高出 16.16\%。
引用
@article{arxiv.1509.02213,
title = {Unsupervised Spoken Term Detection with Spoken Queries by Multi-level Acoustic Patterns with Varying Model Granularity},
author = {Cheng-Tao Chung and Chun-an Chan and Lin-shan Lee},
journal= {arXiv preprint arXiv:1509.02213},
year = {2015}
}
备注
Accepted by ICASSP 2014