中文

用于连续语音分离的全神经网络波束成形器

音频与语音处理 2021-10-14 v1 声音

摘要

连续语音分离(CSS)旨在从包含未知说话人所说未知数量语句的连续对话音频流中分离重叠语音。一个常见应用场景是利用麦克风阵列记录的会议对话转写。先前研究探索了多种用于时频掩码估计的深度学习模型,随后采用最小方差无失真响应(MVDR)滤波器以提升自动语音识别(ASR)准确率。这些方法性能从根本上受限于 MVDR 的空间选择性上限。近来,全深度学习 MVDR(ADL-MVDR)模型被提出用于神经波束成形,并在使用预分段输入的目标语音提取任务中展现出优越性能。本文将 ADL-MVDR 进一步适配至 CSS 任务,并作了若干增强以实现端到端神经波束成形。所提系统在 LibriCSS 数据集上相比基线谱掩码系统取得了显著的词错误率降低。此外,所提神经波束成形器在包括 AMI 在内的真实会议转写任务中与最先进的基于 MVDR 的系统相当,同时展现出通过逐帧处理进一步简化运行时实现并降低系统延迟的潜力。

关键词

引用

@article{arxiv.2110.06428,
  title  = {All-neural beamformer for continuous speech separation},
  author = {Zhuohuang Zhang and Takuya Yoshioka and Naoyuki Kanda and Zhuo Chen and Xiaofei Wang and Dongmei Wang and Sefik Emre Eskimez},
  journal= {arXiv preprint arXiv:2110.06428},
  year   = {2021}
}

备注

5 pages, 3 figures, 2 tables