谁说了什么?一种用于联合解码多说话人及其关键词的潜变量框架
声音
2015-05-01 v1 机器学习
摘要
在本文中,我们提出一种潜变量(LV)框架,用于在给定多说话人混合信号的情况下识别所有说话人及其关键词。我们引入两个独立的LV来表示活跃说话人和所说出的关键词。所说关键词对说话人的依赖通过条件概率质量函数建模。混合信号的分布用LV质量函数和说话人特定关键词模型表达。所提框架接纳随机模型,表示在给定特定说话人说出特定关键词条件下观测向量的概率密度函数,作为说话人特定关键词模型。LV质量函数在最大似然框架下使用期望最大化(EM)算法估计。活跃说话人及其关键词作为两个LV联合分布的模式被检测。在包含两个说话人同时说出关键词的混合信号中,使用Student's-t混合模型作为说话人特定关键词模型,所提框架在检测说话人及其各自关键词方面达到了82%的准确率。
引用
@article{arxiv.1504.08021,
title = {Who Spoke What? A Latent Variable Framework for the Joint Decoding of Multiple Speakers and their Keywords},
author = {Harshavardhan Sundar and Thippur V. Sreenivas},
journal= {arXiv preprint arXiv:1504.08021},
year = {2015}
}
备注
6 pages, 2 figures Submitted to : IEEE Signal Processing Letters