避免自监督语音识别模型中的过度思考
计算与语言
2022-11-17 v1 声音
音频与语音处理
摘要
自监督学习(SSL)模型重塑了我们在语音、语言和视觉领域的研究范式。然而,其庞大的规模以及各层与任务之间不透明的关系导致了推理缓慢和网络过度思考现象,即大型模型最后一层做出的预测反而不如中间层做出的预测。早退(EE)策略可通过在推理时对某些样本动态减少计算量来解决这两个问题。尽管EE在视觉和语言分类任务中很流行,但在序列到序列语音识别(ASR)任务中较少使用,因为早退层输出常常退化。当语音SSL模型应用于分布外(OOD)数据时,这一挑战更加严峻。本文首先表明SSL模型在ASR中确实存在过度思考。随后,我们通过计算性能与速度权衡的最优边界来推动EE的进一步研究。为逼近该边界,我们提出了两种针对ASR的新策略:(1)我们将最近提出的patience策略适配到ASR中;(2)我们设计了一种专门针对ASR的新EE策略,其性能优于此前提出的所有策略。
引用
@article{arxiv.2211.08989,
title = {Avoid Overthinking in Self-Supervised Models for Speech Recognition},
author = {Dan Berrebbi and Brian Yan and Shinji Watanabe},
journal= {arXiv preprint arXiv:2211.08989},
year = {2022}
}