中文

基于随机 wav2vec 2.0 的按需计算缩减

机器学习 2022-04-27 v1 声音 音频与语音处理

摘要

Squeeze and Efficient Wav2vec(SEW)是最近提出的一种架构,它通过压缩 transformer 编码器的输入来实现 wav2vec 2.0(W2V2)模型在预训练和推理时的计算高效性。在本工作中,我们提出用于 W2V2 模型按需计算缩减的随机压缩方法。与使用固定的压缩因子不同,我们在训练期间均匀采样该因子。我们进一步引入了可应用于每个 transformer 层的查询与键值池化机制,以实现进一步压缩。我们在 960h Librispeech 数据集上预训练并在 10h 转写数据上微调的模型结果表明,使用同一随机模型,相较于为特定设置训练的 W2V2 和 SEW 模型,我们可在词错误率(WER)与推理时间之间获得平滑的权衡,且仅带来微小的 WER 退化。我们进一步表明,可将同一随机预训练模型微调至特定配置以恢复 WER 差异,从而从零预训练模型时实现显著的计算节省。

关键词

引用

@article{arxiv.2204.11934,
  title  = {On-demand compute reduction with stochastic wav2vec 2.0},
  author = {Apoorv Vyas and Wei-Ning Hsu and Michael Auli and Alexei Baevski},
  journal= {arXiv preprint arXiv:2204.11934},
  year   = {2022}
}

备注

submitted to Interspeech, 2022