基于古兰经诵读者数据集利用 Wav2Vec2.0 与 HuBERT 实现高效语音识别
声音
2021-11-12 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
当前的认证与可信系统依赖经典和生物特征方法来识别或授权用户。此类方法包括音频语音识别、眼纹和指纹签名。近期工具利用深度学习和 transformer 取得更好结果。在本文中,我们通过使用 Wav2Vec2.0 和 HuBERT 音频表示学习工具,开发了一个用于阿拉伯语说话人识别的深度学习构建模型。端到端 Wav2Vec2.0 范式通过随机掩码一组特征向量来获取上下文化语音表示学习,然后应用一个 transformer 神经网络。我们采用一个能够区分不变标记类别的 MLP 分类器。我们展示了若干实验结果以佐证所提模型的高准确性。实验确保特定说话人的任意波形信号可在 Wav2Vec2.0 和 HuBERT 情形下分别以 98% 和 97.1% 的准确率被识别。
引用
@article{arxiv.2111.06331,
title = {Towards an Efficient Voice Identification Using Wav2Vec2.0 and HuBERT Based on the Quran Reciters Dataset},
author = {Aly Moustafa and Salah A. Aly},
journal= {arXiv preprint arXiv:2111.06331},
year = {2021}
}
备注
5 pages, 9 figures, 2 tables