中文

基于神经网络与音频处理的说话人聚类

声音 2018-03-23 v1 机器学习 音频与语音处理 机器学习

摘要

说话人聚类是在录音中区分不同说话人的任务。在某种意义上,其目标是回答录音中“谁在何时说话”。工业界常用的方法是借助 MFCC 特征直接从录音中进行特征提取,并使用高斯混合模型 (GMM) 和隐马尔可夫模型 (HMM) 等知名技术。本文中,我们研究了神经网络(特别是 CNN)结合聚类与音频处理的方法,以期达到与 SOTA 方法相当的准确率。

关键词

引用

@article{arxiv.1803.08276,
  title  = {Speaker Clustering With Neural Networks And Audio Processing},
  author = {Maxime Jumelle and Taqiyeddine Sakmeche},
  journal= {arXiv preprint arXiv:1803.08276},
  year   = {2018}
}