中文

基于古兰经诵读者数据集利用 Wav2Vec2.0 与 HuBERT 实现高效语音识别

声音 2021-11-12 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

当前的认证与可信系统依赖经典和生物特征方法来识别或授权用户。此类方法包括音频语音识别、眼纹和指纹签名。近期工具利用深度学习和 transformer 取得更好结果。在本文中,我们通过使用 Wav2Vec2.0 和 HuBERT 音频表示学习工具,开发了一个用于阿拉伯语说话人识别的深度学习构建模型。端到端 Wav2Vec2.0 范式通过随机掩码一组特征向量来获取上下文化语音表示学习,然后应用一个 transformer 神经网络。我们采用一个能够区分不变标记类别的 MLP 分类器。我们展示了若干实验结果以佐证所提模型的高准确性。实验确保特定说话人的任意波形信号可在 Wav2Vec2.0 和 HuBERT 情形下分别以 98% 和 97.1% 的准确率被识别。

关键词

引用

@article{arxiv.2111.06331,
  title  = {Towards an Efficient Voice Identification Using Wav2Vec2.0 and HuBERT Based on the Quran Reciters Dataset},
  author = {Aly Moustafa and Salah A. Aly},
  journal= {arXiv preprint arXiv:2111.06331},
  year   = {2021}
}

备注

5 pages, 9 figures, 2 tables