中文

面向 Transformer Transducer 语音识别的说话人变更检测

音频与语音处理 2023-02-20 v1 声音

摘要

说话人变更检测(SCD)是一项重要功能,它通过在说话人变更点将词序列切分为段落,从而提高自动语音识别(ASR)系统所识别词的可读性。现有的 SCD 方案要么需要额外的集成来处理基于时间的决策和已识别词序列,要么在 ASR 与 SCD 之间实现紧耦合,限制了两项任务潜在的最优性能。为解决这些问题,我们提出一种用于 SCD 任务的新颖框架,其中在现有 Transformer Transducer ASR(TT-ASR)网络之上构建一个额外的 SCD 模块。该框架中探索了 SCD 网络的两种变体,可自然估计每个词的说话人变更概率,同时允许 ASR 和 SCD 采用独立的优化方案以获得最佳性能。实验表明,与联合 SCD 和 ASR 基线相比,我们的方法在 LibriCSS 和微软呼叫中心数据集上能显著提升 F1 分数,且 ASR 性能不退化。

关键词

引用

@article{arxiv.2302.08549,
  title  = {Speaker Change Detection for Transformer Transducer ASR},
  author = {Jian Wu and Zhuo Chen and Min Hu and Xiong Xiao and Jinyu Li},
  journal= {arXiv preprint arXiv:2302.08549},
  year   = {2023}
}

备注

5 pages, 1 figure, accepted by ICASSP 2023