语音分离引导的会议在线说话人日志
音频与语音处理
2024-02-02 v1 机器学习
声音
信号处理
摘要
重叠语音对于说话人日志系统而言是众所周知的难题。因此,最近有人提出使用语音分离来提升其性能。尽管前景广阔,但语音分离模型在处理真实数据时仍面临挑战,因为它们是在具有固定说话人数量的模拟混合数据上训练的。在这项工作中,我们引入了一种新的语音分离引导的日志方案,适用于具有可变说话人数量的长会议录音的在线说话人日志,如AMI语料库中的情况。我们考虑将ConvTasNet和DPRNN作为分离网络的替代方案,并设置两个或三个输出源。为了获得说话人日志结果,我们对每个估计的源进行语音活动检测。在首先使用AMI数据将分离模型适应于真实数据后,最终模型进行端到端微调。该系统在短片段上运行,并通过使用说话人嵌入和增量聚类拼接局部预测来进行推理。结果表明,我们的系统在AMI头戴式麦克风混合录音上,不使用任何先验信息,并在完全评估(无宽容区间且包含重叠语音)的条件下,改进了当前最先进水平。最后,我们展示了我们的系统在重叠语音部分上的特别优势。
引用
@article{arxiv.2402.00067,
title = {Online speaker diarization of meetings guided by speech separation},
author = {Elio Gruttadauria and Mathieu Fontaine and Slim Essid},
journal= {arXiv preprint arXiv:2402.00067},
year = {2024}
}
备注
Accepted at ICASSP 2024