基于神经网络与音频处理的说话人聚类
声音
2018-03-23 v1 机器学习
音频与语音处理
机器学习
摘要
说话人聚类是在录音中区分不同说话人的任务。在某种意义上,其目标是回答录音中“谁在何时说话”。工业界常用的方法是借助 MFCC 特征直接从录音中进行特征提取,并使用高斯混合模型 (GMM) 和隐马尔可夫模型 (HMM) 等知名技术。本文中,我们研究了神经网络(特别是 CNN)结合聚类与音频处理的方法,以期达到与 SOTA 方法相当的准确率。
引用
@article{arxiv.1803.08276,
title = {Speaker Clustering With Neural Networks And Audio Processing},
author = {Maxime Jumelle and Taqiyeddine Sakmeche},
journal= {arXiv preprint arXiv:1803.08276},
year = {2018}
}