中文

场景感知语音识别:在 Apollo Fearless Steps 与 CHiME-4 语料上的进展

声音 2021-09-24 v1 机器学习 音频与语音处理

摘要

在本研究中,我们提出考察三元组损失(triplet loss)以作为一种用于 ASR 的替代特征表示。我们考虑一种通用的非语义语音表示,其基于称为 TRILL 的以三元组损失为自监督准则训练得到,用于声学建模以表征每段音频的声学特性。该策略随后应用于 CHiME-4 语料和 CRSS-UTDallas Fearless Steps 语料,重点在于由 5 个选定 NASA Apollo-11 通道组成的 100 小时挑战语料。对所提取嵌入的分析提供了将训练语句依据声学区分特性划分为不同组所需的基础。此外,我们还证明基于三元组损失的嵌入在声学建模上优于 i-Vector,确认三元组损失比说话人特征更有效。借助发音与静音概率建模以及多风格训练等附加技术,我们在 Fearless Steps 语料的开发集和评估集上分别实现了 +5.42% 和 +3.18% 的相对 WER 提升。为探索泛化性,我们进一步在 CHiME-4 的单通道轨道上测试相同技术,并观测到真实测试数据上 +11.90% 的相对 WER 提升。

关键词

引用

@article{arxiv.2109.11086,
  title  = {Scenario Aware Speech Recognition: Advancements for Apollo Fearless Steps & CHiME-4 Corpora},
  author = {Szu-Jui Chen and Wei Xia and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2109.11086},
  year   = {2021}
}

备注

Accepted for ASRU 2021