中文

面向电话对话的低延迟语音分离引导说话人日志方法

音频与语音处理 2022-10-28 v2

摘要

本文对语音分离引导说话人日志(SSGD)在电话对话中的使用进行了分析。SSGD通过分离说话人信号并对每个估计的说话人信号应用语音活动检测来完成日志。具体而言,我们比较了两种低延迟语音分离模型。此外,我们展示了一种后处理算法,可显著减少SSGD流水线的误报错误。我们在两个数据集上进行了实验:Fisher Corpus Part 1和CALLHOME,评估了分离和日志指标。值得注意的是,我们基于DPRNN的SSGD在线模型在CALLHOME上取得了11.1%的DER,尽管训练数据量少一个数量级且延迟显著降低(即0.1秒对比10秒),但仍与大多数最先进的端到端神经日志模型相当。我们还表明,分离信号可直接输入语音识别后端,性能接近理想源信号。

关键词

引用

@article{arxiv.2204.02306,
  title  = {Low-Latency Speech Separation Guided Diarization for Telephone Conversations},
  author = {Giovanni Morrone and Samuele Cornell and Desh Raj and Luca Serafini and Enrico Zovato and Alessio Brutti and Stefano Squartini},
  journal= {arXiv preprint arXiv:2204.02306},
  year   = {2022}
}

备注

Accepted for Presentation at IEEE Spoken Language Technology Workshop (SLT) 2022