口语理解是否仍需要自动语音识别?
音频与语音处理
2021-12-01 v1 计算与语言
机器学习
摘要
口语理解(SLU)任务通常通过先用自动语音识别(ASR)转写话语,再将输出送入基于文本的模型来解决。近期语音数据自监督表示学习的进展集中于改进 ASR 组件。我们探究语音表示学习是否已足够成熟以在 SLU 中替代 ASR。我们将来自 wav2vec 2.0 的学习语音特征、最先进的 ASR 转写文本以及真实文本作为新型基于语音的命名实体识别任务、真实世界急救呼叫中的心脏骤停检测任务以及两个现有 SLU 基准的输入进行比较。我们表明,在三项分类任务上,学习语音特征优于 ASR 转写文本。对于机器翻译,ASR 转写文本仍是更好的选择。我们强调 wav2vec 2.0 表示对词汇表外单词的固有鲁棒性是实现更优性能的关键。
引用
@article{arxiv.2111.14842,
title = {Do We Still Need Automatic Speech Recognition for Spoken Language Understanding?},
author = {Lasse Borgholt and Jakob Drachmann Havtorn and Mostafa Abdou and Joakim Edin and Lars Maaløe and Anders Søgaard and Christian Igel},
journal= {arXiv preprint arXiv:2111.14842},
year = {2021}
}
备注
Under review as a conference paper at ICASSP 2022