中文

容忍说话人聚类中样本大小效应的相似度度量

声音 2007-05-23 v1 多媒体

摘要

我们研究了说话人聚类中对称 Kullback-Leibler (KL2) 距离及其对不同尺寸特征矩阵的未报告影响。说话人数据表示为梅尔频率倒谱系数 (MFCC) 向量,使用 KL2 度量比较特征,以形成每个说话人的语音片段聚类。我们对基于 KL2 的聚类提出两个观察:1.) 聚类准确率严重依赖于语音片段及其提取特征向量的绝对长度。2.) 相似度度量的准确性会随较短语音片段的长度而显著下降。这些长度效应可归因于 KL2 中使用的协方差度量。我们演示了对这种样本大小效应的经验性修正,可提高聚类准确率。我们与两种基于向量量化 (VQ) 的相似度度量进行了类比,其中一种 exhibits 类似的样本大小效应,另一种则不受其影响。

关键词

引用

@article{arxiv.cs/0612138,
  title  = {Accommodating Sample Size Effect on Similarity Measures in Speaker Clustering},
  author = {Alexander Haubold and John R. Kender},
  journal= {arXiv preprint arXiv:cs/0612138},
  year   = {2007}
}