中文

FeaRLESS:用于鲁棒端到端语音识别中自监督学习特征集成的特征精炼损失

声音 2022-07-01 v1 机器学习 音频与语音处理

摘要

自监督学习表征(SSLR)已在诸多领域的下游任务中产出鲁棒特征。近来,若干 SSLR 在自动语音识别(ASR)基准语料上展现出有前景的结果。然而,既往研究仅将单独的 SSLR 作为 ASR 模型输入特征的表现予以展示。在本研究中,我们拟探究在端到端(E2E)ASR 模型内使用多种融合方法组合不同 SSLR 的有效性。此外,我们将展示这些提取出的 SSLR 之间存在相关性。为此,我们进一步提出一种用于去相关的特征精炼损失,以高效组合该组输入特征。在评估中,我们表明所提出的“FeaRLESS 学习特征”在 WSJ 与 Fearless Steps Challenge(FSC)语料上均优于未采用所提特征精炼损失的系统。

关键词

引用

@article{arxiv.2206.15056,
  title  = {FeaRLESS: Feature Refinement Loss for Ensembling Self-Supervised Learning Features in Robust End-to-end Speech Recognition},
  author = {Szu-Jui Chen and Jiamin Xie and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2206.15056},
  year   = {2022}
}

备注

Accepted for Interspeech 2022