中文

多通道神经变换器的自监督学习

计算与语言 2024-08-07 v1 声音 音频与语音处理

摘要

自监督学习,例如 wav2vec 2.0 框架,显著提升了端到端自动语音识别(ASR)的准确性。wav2vec 2.0 已被应用于单通道端到端 ASR 模型。在本工作中,我们探索了基于 wav2vec 2.0 框架的多通道端到端 ASR 模型的自监督学习方法。作为多通道端到端 ASR 模型,我们聚焦于多通道神经变换器。在预训练阶段,我们比较了三种不同的特征量化方法来训练多通道 Conformer 音频编码器:联合量化、逐特征量化和逐通道量化。在微调阶段,我们训练了多通道 Conformer-变换器。所有实验均使用远场内部数据集和 CHiME-4 数据集进行。实验结果表明,逐特征量化是三种方法中最有效的。与无任何预训练的模型相比,远场内部数据集上的字符错误率相对降低了 66%。

关键词

引用

@article{arxiv.2408.02945,
  title  = {Self-Supervised Learning for Multi-Channel Neural Transducer},
  author = {Atsushi Kojima},
  journal= {arXiv preprint arXiv:2408.02945},
  year   = {2024}
}