中文

BW-EDA-EEND:面向可变说话人数量的流式端到端神经说话人日志系统

声音 2022-02-22 v2 计算与语言 音频与语音处理

摘要

我们提出了一种新颖的在线端到端神经日志系统 BW-EDA-EEND,该系统以增量方式处理数据,适用于可变数量的说话人。该系统基于 Horiguchi 等人的编码器-解码器-吸引子(EDA)架构,但采用增量式 Transformer 编码器,仅关注其左侧上下文,并在隐藏状态中使用块级循环以将信息从一个块传递到下一个块,使算法复杂度在时间上呈线性。我们提出了两种变体:对于以线性时间处理输入的无限延迟 BW-EDA-EEND,我们表明,与使用 10 秒上下文大小的离线 EDA-EEND 相比,在最多两位说话人时仅有适度性能下降。当说话人超过两位时,在线与离线之间的精度差距增大,但该算法在上下文大小无限时仍优于基线的离线聚类日志系统(适用于一至四位说话人),并且在上下文大小为 10 秒时显示出可比的精度。对于随音频到达逐块产生日志输出的有限延迟 BW-EDA-EEND,我们展示了与离线基于聚类的系统相当的精度。

关键词

引用

@article{arxiv.2011.02678,
  title  = {BW-EDA-EEND: Streaming End-to-End Neural Speaker Diarization for a Variable Number of Speakers},
  author = {Eunjung Han and Chul Lee and Andreas Stolcke},
  journal= {arXiv preprint arXiv:2011.02678},
  year   = {2022}
}