一种基于矢量量化和二阶统计量的高速无监督说话人检索方法
信息检索
2010-09-13 v2 声音
摘要
本文描述了一种有效的无监督方法,用于基于示例的说话人检索。我们假设每个音频文件或音频片段中只有一个说话人。音频数据使用一个通用的通用码本进行建模。该码本基于帧袋(BOF)方法。从所有音频文件中提取与音频帧对应的特征。这些特征通过K-means算法聚类成簇。每个音频文件通过该文件对应的簇箱数量的归一化分布进行建模。在第一阶段,使用向量空间表示检索与查询文件最相似的k个近邻。在第二阶段,对得到的k个近邻应用二阶统计量,以确定检索的最终结果。所述方法在法语广播新闻Ester语料库的子集上进行了评估。
引用
@article{arxiv.1008.4658,
title = {A high speed unsupervised speaker retrieval using vector quantization and second-order statistics},
author = {Konstantin Biatov},
journal= {arXiv preprint arXiv:1008.4658},
year = {2010}
}