中文

基于连续语音分离与转写支持说话人日志的会议识别

音频与语音处理 2024-05-07 v2 声音

摘要

我们提出了一种用于会议风格录音的单通道分离、识别与说话人日志的模块化流水线,并在 Libri-CSS 数据集上进行了评估。使用具有 TF-GridNet 分离架构的连续语音分离(Continuous Speech Separation, CSS)系统,随后接一个说话人无关语音识别器,我们在最优参考组合词错误率(Optimal Reference Combination Word Error Rate, ORC WER)方面取得了最先进的识别性能。然后,采用基于 d-vector 的说话人日志模块从增强信号中提取说话人嵌入,并将 CSS 输出分配给正确的说话人。在此,我们提出一种利用 ASR 模块的句级与词级边界的句法知情说话人日志,以支持说话人轮次检测。这使得完整会议识别流水线取得了最先进的拼接最小置换词错误率(Concatenated minimum-Permutation Word Error Rate, cpWER)。

关键词

引用

@article{arxiv.2309.16482,
  title  = {Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization},
  author = {Thilo von Neumann and Christoph Boeddeker and Tobias Cord-Landwehr and Marc Delcroix and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2309.16482},
  year   = {2024}
}

备注

Accepted at HSCMA Sattelite Workshop at ICASSP 2024