通过无限高斯混合模型深度展开实现神经与聚类说话人日志的紧密集成
音频与语音处理
2022-02-15 v1 机器学习
声音
摘要
说话人日志作为会议分析的一项重要核心任务已被广泛研究。近期趋势表明,端到端神经(EEND)与基于聚类的说话人日志的集成是处理含重叠语音、说话人数量任意多的真实对话数据的一种有前景的方法,并在多项任务上取得了最先进结果。然而,迄今提出的方法尚未实现“紧密”集成,因为其中所用的聚类对于聚类由 EEND 模块估计的说话人嵌入而言在任何意义上都不是最优的。为解决该问题,本文通过将称为无限高斯混合模型(iGMM)的非参数贝叶斯模型深度展开,将一种“可训练”的聚类算法引入集成框架。具体而言,基于一种基于调整兰德指数(ARI)的新聚类损失,在训练期间优化说话人嵌入使其更契合 iGMM 聚类。基于 CALLHOME 数据的实验结果表明,所提方法在说话人日志错误率(DER)方面优于传统方法,尤其大幅减少了说话人混淆错误,这确实反映了所提 iGMM 集成的有效性。
引用
@article{arxiv.2202.06524,
title = {Tight integration of neural- and clustering-based diarization through deep unfolding of infinite Gaussian mixture model},
author = {Keisuke Kinoshita and Marc Delcroix and Tomoharu Iwata},
journal= {arXiv preprint arXiv:2202.06524},
year = {2022}
}
备注
Accepted to IEEE ICASSP-2022, 5 pages, 2 figures