中文

关于使用 SURT 的说话人归因

音频与语音处理 2024-01-30 v1 声音

摘要

Streaming Unmixing and Recognition Transducer (SURT) 最近已成为连续、流式、多人语音识别(ASR)的流行框架。随着架构、目标和混合模拟方法的进步,已证明 SURT 可以成为一种用于真实会议的与说话人无关的转录的高效流式方法。在这项工作中,我们通过提出使用 SURT 执行说话人归因转录的方法,将此框架进一步推进,适用于短混合和长录音。我们通过向 SURT 添加辅助说话人分支,并通过 HAT 风格的空白分解将其标签预测与 ASR token 预测同步来实现这一点。为了确保录音中不同话语组之间相对说话人标签的一致性,我们提出了“说话人前缀”——将先前块中识别出的说话人的高置信度帧附加到每个块,以建立相对顺序。我们在合成 LibriSpeech 混合上进行了广泛的消融实验以验证我们的设计选择,并在 AMI 语料库上展示了我们最终模型的有效性。

关键词

引用

@article{arxiv.2401.15676,
  title  = {On Speaker Attribution with SURT},
  author = {Desh Raj and Matthew Wiesner and Matthew Maciejewski and Leibny Paola Garcia-Perera and Daniel Povey and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2401.15676},
  year   = {2024}
}

备注

8 pages, 6 figures, 6 tables. Submitted to Odyssey 2024