深度学习在说话人识别中的应用:基于 AB-1 语料库分析的架构洞察与性能评估
声音
2024-10-29 v1 人工智能
音频与语音处理
摘要
在安全系统、法医调查和个性化服务等领域,语音作为人类基本输入的重要性超过文本交互。本研究深入探讨说话人识别(SID)的复杂领域,研究其核心组件,重点关注梅尔频谱图和梅尔频率倒谱系数(MFCC)用于特征提取。此外,本研究通过广泛分析评估了六种略有不同的模型架构的性能,并对表现最佳的模型进行了超参数调优。本工作还进行了语言学分析以验证口音和性别准确性,并评估了 AB-1 语料库数据集中的偏差。
引用
@article{arxiv.2408.06804,
title = {Deep Learning for Speaker Identification: Architectural Insights from AB-1 Corpus Analysis and Performance Evaluation},
author = {Matthias Bartolo},
journal= {arXiv preprint arXiv:2408.06804},
year = {2024}
}
备注
Resultant work from Assignment, Department of AI, University of Malta. Code available at: https://github.com/mbar0075/Speech-Technology