中文

基于 Wav2Vec2 与迁移学习的孟加拉语自动语音识别系统

音频与语音处理 2022-09-21 v2 计算与语言 声音

摘要

将口语自动解码并转写的方法称为自动语音识别 (ASR)。典型的 ASR 系统从音频记录或流中提取特征,并运行一个或多个算法将特征映射到相应文本。近年来,在语音信号处理领域已完成大量研究。当给定充足资源时,传统 ASR 与新兴端到端 (E2E) 语音识别均产生了有前景的结果。然而,对于像孟加拉语这样的低资源语言,当前 ASR 状态落后,尽管低资源状态并不反映该语言被全球超过 5 亿人使用这一事实。尽管其流行,可用的多样化开源数据集并不多,这使得孟加拉语语音识别系统的研究困难。本文是名为“BUET CSE Fest DL Sprint”竞赛的一部分。本文旨在通过基于迁移学习框架在 E2E 结构上采用语音识别技术,改善孟加拉语的语音识别性能。所提方法有效建模了孟加拉语,并在 7747 个样本的测试数据集上以仅使用 1000 个训练样本训练取得了 3.819 的“Levenshtein 平均距离”分数。

关键词

引用

@article{arxiv.2209.08119,
  title  = {An Automatic Speech Recognition System for Bengali Language based on Wav2Vec2 and Transfer Learning},
  author = {Tushar Talukder Showrav},
  journal= {arXiv preprint arXiv:2209.08119},
  year   = {2022}
}

备注

BUET DL Sprint, 4 pages