基于人工神经网络从连续孟加拉语语音识别说话人所属行政区
音频与语音处理
2024-04-24 v1 人机交互
机器学习
声音
摘要
在自动化时代,基于语音的应用占据主导地位,因为语音包含大量决定说话人信息及语音本身的因素。现代自动语音识别(Automatic Speech Recognition, ASR)借助人工智能技术实现人与设备间的高效通信,是人机交互(Human-Computer Interaction, HCI)领域的一大福音。语音是最简单的通信媒介之一,因为其对于不同说话人具有大量同一性特征。如今,通过说话人的语音可以确定说话人及其身份,即说话人识别。本文提出了一种方法,能够利用连续孟加拉语语音提供说话人在特定区域的地理身份。我们将孟加拉国的八个不同行政区作为地理区域。我们应用梅尔频率倒谱系数(Mel Frequency Cepstral Coefficient, MFCC)和Delta特征于人工神经网络,对说话人所属行政区进行分类。在特征提取之前,我们执行了一些预处理任务,包括降噪和对原始音频进行8-10秒的分割。我们使用了包含来自633名男女说话人超过45小时音频数据的数据集。我们记录到的最高准确率为85.44%。
引用
@article{arxiv.2404.15168,
title = {Artificial Neural Networks to Recognize Speakers Division from Continuous Bengali Speech},
author = {Hasmot Ali and Md. Fahad Hossain and Md. Mehedi Hasan and Sheikh Abujar and Sheak Rashed Haider Noori},
journal= {arXiv preprint arXiv:2404.15168},
year = {2024}
}