中文

基于目标说话人声学模型的单声道对话录音同步语音识别与说话人日志

计算与语言 2019-09-19 v1 声音 音频与语音处理

摘要

本文研究利用目标说话人自动语音识别 (TS-ASR) 对单通道对话录音进行同步语音识别与说话人日志。TS-ASR 是一种在给定该说话人简短样本语句的条件下,自动提取并识别仅目标说话人语音的技术。TS-ASR 一个明显的缺陷是,当录音中说话人未知时无法使用,因为它需要在解码前预先获得目标说话人的样本。为消除此限制,我们提出一种迭代方法,其中 (i) 说话人嵌入的估计与 (ii) 基于估计说话人嵌入的 TS-ASR 交替执行。我们使用说话人重叠率超过 20% 的极具挑战性的对话录音评估了所提方法。我们确认所提方法显著降低了词错误率 (WER) 和日志错误率 (DER)。我们结合 i-vector 说话人嵌入的所提方法最终实现的 WER 与给定预言说话人嵌入的 TS-ASR 仅相差 2.1%。此外,我们的方法可同时作为副产物解决说话人日志问题,并取得了优于基于 i-vector 的传统聚类式说话人日志方法的 DER。

关键词

引用

@article{arxiv.1909.08103,
  title  = {Simultaneous Speech Recognition and Speaker Diarization for Monaural Dialogue Recordings with Target-Speaker Acoustic Models},
  author = {Naoyuki Kanda and Shota Horiguchi and Yusuke Fujita and Yawen Xue and Kenji Nagamatsu and Shinji Watanabe},
  journal= {arXiv preprint arXiv:1909.08103},
  year   = {2019}
}

备注

Accepted to ASRU 2019