中文

端到端神经与聚类式说话人日志的融合:兼取两者之长

音频与语音处理 2021-02-08 v2 声音 机器学习

摘要

近期的说话人日志技术可分为两类方法,即聚类式和端到端神经式,它们各有优劣。聚类式方法通过对 x-vectors 等说话人嵌入进行聚类来为语音区域分配说话人标签。虽然它可视为在当前各种具有合理鲁棒性与准确性的挑战性数据上工作的前沿方法,但它有一个关键缺点:无法处理自然对话数据中不可避免的重叠语音。相比之下,端到端神经说话人日志(EEND)使用神经网络直接预测日志标签,其设计初衷正是处理重叠语音。尽管 EEND 可轻松融入新兴深度学习技术,并已在某些真实数据库上开始超越 x-vector 聚类方法,但由于例如其巨大的内存消耗,它难以处理“长”录音(如长于 10 分钟的录音)。分块独立处理同样困难,因为这会引发块间标签置换问题,即块间说话人标签分配的不确定性。本文中,我们提出一种简单而有效的混合日志框架,可处理重叠语音并适用于含任意说话人数的长录音。它改进了传统 EEND 框架以同时输出全局说话人嵌入,从而可在块间进行说话人聚类以解决置换问题。基于模拟含噪混响双说话人会议式数据的实验表明,所提框架尤其当输入数据较长时显著优于原始 EEND。

关键词

引用

@article{arxiv.2010.13366,
  title  = {Integrating end-to-end neural and clustering-based diarization: Getting the best of both worlds},
  author = {Keisuke Kinoshita and Marc Delcroix and Naohiro Tawara},
  journal= {arXiv preprint arXiv:2010.13366},
  year   = {2021}
}

备注

To appear in ICASSP 2021