中文

“休斯顿,请重复一遍”:Behavox系统用于Apollo-11无畏步骤挑战赛(第二阶段)

音频与语音处理 2020-08-05 v1 计算与语言 声音

摘要

我们描述了Behavox团队为Interspeech 2020无畏步骤挑战赛(FSC-2)所进行的语音活动检测(SAD)、说话人日记化(SD)和自动语音识别(ASR)实验。相对较少的标注数据、大量不同的说话人与信道失真、特定词汇表及说话风格导致涉及该数据的系统错误率较高。除约36小时标注的NASA任务录音外,组织者还提供了更大但未标注的19k小时Apollo-11语料库,我们也将其用于ASR声学模型和语言模型的半监督训练,观察到相比仅在FSC-2数据上训练有超过17%的相对词错误率提升。我们还比较了若干SAD和SD系统以应对该挑战最困难的赛道(用于日记化和ASR的赛道1),其中提供了长达30分钟的长音频录音用于评估,无分段或说话人信息。所有系统中,我们均报告了相比FSC-2基线系统的显著性能提升,并在该挑战赛中取得SD和ASR第一名以及SAD第四名。

关键词

引用

@article{arxiv.2008.01504,
  title  = {"This is Houston. Say again, please". The Behavox system for the Apollo-11 Fearless Steps Challenge (phase II)},
  author = {Arseniy Gorin and Daniil Kulko and Steven Grima and Alex Glasman},
  journal= {arXiv preprint arXiv:2008.01504},
  year   = {2020}
}

备注

Accepted to Interspeech 2020