FeaRLESS:用于鲁棒端到端语音识别中自监督学习特征集成的特征精炼损失
声音
2022-07-01 v1 机器学习
音频与语音处理
摘要
自监督学习表征(SSLR)已在诸多领域的下游任务中产出鲁棒特征。近来,若干 SSLR 在自动语音识别(ASR)基准语料上展现出有前景的结果。然而,既往研究仅将单独的 SSLR 作为 ASR 模型输入特征的表现予以展示。在本研究中,我们拟探究在端到端(E2E)ASR 模型内使用多种融合方法组合不同 SSLR 的有效性。此外,我们将展示这些提取出的 SSLR 之间存在相关性。为此,我们进一步提出一种用于去相关的特征精炼损失,以高效组合该组输入特征。在评估中,我们表明所提出的“FeaRLESS 学习特征”在 WSJ 与 Fearless Steps Challenge(FSC)语料上均优于未采用所提特征精炼损失的系统。
引用
@article{arxiv.2206.15056,
title = {FeaRLESS: Feature Refinement Loss for Ensembling Self-Supervised Learning Features in Robust End-to-end Speech Recognition},
author = {Szu-Jui Chen and Jiamin Xie and John H. L. Hansen},
journal= {arXiv preprint arXiv:2206.15056},
year = {2022}
}
备注
Accepted for Interspeech 2022