语音分离、说话人日记化与识别的集成用于多说话人会议:系统描述、比较与分析
音频与语音处理
2020-11-05 v1 声音
摘要
对非分段录音的多说话人语音识别具有多种应用,如会议转写与自动字幕生成。随着过去十年中处理语音分离、说话人日记化(diarization)与自动语音识别(ASR)系统的技术进展,构建在此任务上达到合理错误率的流水线已成为可能。本文针对 LibriCSS 会议数据提出一种端到端模块化系统,其按序组合独立训练的分离、日记化与识别组件。我们研究了流水线各阶段不同前沿方法的效果,并使用 SDR、DER 等任务特定指标以及下游 WER 报告结果。实验表明,日记化与 ASR 中的重叠语音问题可借由训练良好的分离模块得到有效缓解。我们的最佳系统取得了 12.7% 的说话人归属 WER,接近非重叠 ASR 的水平。
引用
@article{arxiv.2011.02014,
title = {Integration of speech separation, diarization, and recognition for multi-speaker meetings: System description, comparison, and analysis},
author = {Desh Raj and Pavel Denisov and Zhuo Chen and Hakan Erdogan and Zili Huang and Maokui He and Shinji Watanabe and Jun Du and Takuya Yoshioka and Yi Luo and Naoyuki Kanda and Jinyu Li and Scott Wisdom and John R. Hershey},
journal= {arXiv preprint arXiv:2011.02014},
year = {2020}
}
备注
Accepted to IEEE SLT 2021