端到端语音识别模型是否在意上下文?
音频与语音处理
2021-02-22 v1 计算与语言
机器学习
声音
摘要
端到端语音识别最常见的两种范式是连接主义时序分类(CTC)与基于注意力的编码器-解码器(AED)模型。有观点认为后者更适于学习隐式语言模型。我们通过测量时间上下文敏感性并评估在约束音频输入中上下文信息量时模型的表现来检验该假设。我们发现 AED 模型确实对上下文更敏感,但通过在 CTC 模型中加入自注意力可缩小这一差距。此外,在上下文信息受约束时两种模型表现相似。最后,与先前研究相反,我们的结果表明 CTC 模型在无需外部语言模型辅助下于 WSJ 和 LibriSpeech 上极具竞争力。
引用
@article{arxiv.2102.09928,
title = {Do End-to-End Speech Recognition Models Care About Context?},
author = {Lasse Borgholt and Jakob Drachmann Havtorn and Željko Agić and Anders Søgaard and Lars Maaløe and Christian Igel},
journal= {arXiv preprint arXiv:2102.09928},
year = {2021}
}
备注
Published in the proceedings of INTERSPEECH 2020, pp. 4352-4356