中文

用于语音段聚类的特征轨迹动态时间规整

声音 2018-10-31 v1 机器学习 音频与语音处理 机器学习

摘要

动态时间规整(DTW)可用于计算两个通常长度不同的序列之间的相似度。我们提出一种对 DTW 的改进,其对特征轨迹进行独立且逐对的单独对齐。这一称为特征轨迹动态时间规整(FTDTW)的改进技术,被用作语音段凝聚式层次聚类中的相似度度量。使用从 TIMIT 和口语阿拉伯数字数据集(SADD)提取的 MFCC 与 PLP 参数化的实验表明,在 F-measure 与归一化互信息(NMI)方面,所得聚类的质量有持续且统计显著的提升。

关键词

引用

@article{arxiv.1810.12722,
  title  = {Feature Trajectory Dynamic Time Warping for Clustering of Speech Segments},
  author = {Lerato Lerato and Thomas Niesler},
  journal= {arXiv preprint arXiv:1810.12722},
  year   = {2018}
}

备注

10 pages