中文

端到端神经与聚类相结合的说话人日志化在真实对话语音中的集成进展

音频与语音处理 2021-09-01 v2 声音

摘要

近来,我们提出了一种称为端到端神经日志化-向量聚类(EEND-vector clustering)的新型说话人日志化方法,该方法将基于聚类的与基于端到端神经网络的日志化方法集成于同一框架中。所提方法结合了两种框架的优势,即基于 EEND 的高日志化性能与对重叠语音的处理能力,以及基于聚类方法对任意人数长录音的鲁棒处理能力。然而,该方法此前仅在模拟的双人会议类数据上进行了评估。本文旨在(1)报告我们对该框架取得的最新进展,包括新引入的鲁棒约束聚类算法;(2)通过实验表明,在包含重叠语音与任意人数真实对话语音的 CALLHOME 数据上,该方法现在可显著优于编码器-解码器吸引子(EDA)-EEND 等竞争性日志化方法。通过进一步分析实验结果,本文还讨论了所提方法的优缺点并揭示了进一步改进的潜力。用于复现结果的一套代码发布于 https://github.com/nttcslab-sp/EEND-vector-clustering。

关键词

引用

@article{arxiv.2105.09040,
  title  = {Advances in integration of end-to-end neural and clustering-based diarization for real conversational speech},
  author = {Keisuke Kinoshita and Marc Delcroix and Naohiro Tawara},
  journal= {arXiv preprint arXiv:2105.09040},
  year   = {2021}
}

备注

5 pages, 1 figure, Interspeech2021. (Update to include a reference to the code)