用于语音段聚类的特征轨迹动态时间规整
声音
2018-10-31 v1 机器学习
音频与语音处理
机器学习
摘要
动态时间规整(DTW)可用于计算两个通常长度不同的序列之间的相似度。我们提出一种对 DTW 的改进,其对特征轨迹进行独立且逐对的单独对齐。这一称为特征轨迹动态时间规整(FTDTW)的改进技术,被用作语音段凝聚式层次聚类中的相似度度量。使用从 TIMIT 和口语阿拉伯数字数据集(SADD)提取的 MFCC 与 PLP 参数化的实验表明,在 F-measure 与归一化互信息(NMI)方面,所得聚类的质量有持续且统计显著的提升。
引用
@article{arxiv.1810.12722,
title = {Feature Trajectory Dynamic Time Warping for Clustering of Speech Segments},
author = {Lerato Lerato and Thomas Niesler},
journal= {arXiv preprint arXiv:1810.12722},
year = {2018}
}
备注
10 pages