中文

wav2vec 2.0 特征提取器的比较分析

音频与语音处理 2023-08-09 v1 计算与语言 机器学习 声音

摘要

自动语音识别 (ASR) 系统通常使用手工设计的特征提取流程。为避免其固有的信息损失并实现从语音到转写文本更一致的建模,神经原始波形特征提取器 (FE) 是一种引人关注的方法。近期广受欢迎的 wav2vec 2.0 模型同样使用直接作用于语音波形的卷积 FE。然而,文献中尚未对其展开广泛研究。本工作中,我们研究其在连接时序分类 (CTC) ASR 模型中替代标准特征提取方法的能力,并将其与另一种神经 FE 进行比较。我们表明二者在 LibriSpeech 基准上均与传统的 FE 具有竞争力,并分析了各组成部分的影响。此外,我们分析了所学滤波器,表明对 ASR 系统最重要的信息由一组带通滤波器获取。

关键词

引用

@article{arxiv.2308.04286,
  title  = {Comparative Analysis of the wav2vec 2.0 Feature Extractor},
  author = {Peter Vieting and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2308.04286},
  year   = {2023}
}

备注

Accepted at ITG 2023