中文

基于Toeplitz逆协方差的自然音频流鲁棒说话人聚类

声音 2019-07-15 v1 机器学习 音频与语音处理

摘要

说话人日志确定音频流中“谁在何时说话”。在本研究中, 我们提出一种基于模型、利用 i-vector 的鲁棒说话人聚类方法。从同一说话人不同片段提取的 i-vector 是相互关联的。我们用马尔可夫随机场(MRF)网络对这种关联建模。借助 MRF 建模的进展, 我们使用 Toeplitz 逆协方差(TIC)矩阵来表示每个说话人的 MRF 关联网络。该方法捕捉了属于音频流中同一说话人的 i-vector(或等效说话人轮次)的序列结构。我们采用标准期望最大化(EM)算法的一个变体, 利用动态规划(DP)与交替方向乘子法(ADMM)推导闭式解。我们的日志系统包含四步: (1) 真值分割; (2) i-vector 提取; (3) 后处理(均值相减、主成分分析与长度归一化); (4) 所提出的说话人聚类。我们采用余弦 K-means 与 movMF 说话人聚类作为基线方法。我们的评估数据来自: (i) CRSS-PLTL 语料库, 与 (ii) AMI 语料库的两个会议子集。相较基线, 使用所提改进在 CRSS-PLTL 语料库上的日志错误率(DER)相对降低为 43.22%。对于 AMI 会议 IS1000a 与 IS1003b, DER 相对降低分别为 29.37% 与 9.21%。

关键词

引用

@article{arxiv.1907.05584,
  title  = {Toeplitz Inverse Covariance based Robust Speaker Clustering for Naturalistic Audio Streams},
  author = {Harishchandra Dubey and Abhijeet Sangwan and John Hansen},
  journal= {arXiv preprint arXiv:1907.05584},
  year   = {2019}
}

备注

6 Pages, 3 Fiigures, 5 Equations