中文

深度学习在说话人识别中的应用:基于 AB-1 语料库分析的架构洞察与性能评估

声音 2024-10-29 v1 人工智能 音频与语音处理

摘要

在安全系统、法医调查和个性化服务等领域,语音作为人类基本输入的重要性超过文本交互。本研究深入探讨说话人识别(SID)的复杂领域,研究其核心组件,重点关注梅尔频谱图和梅尔频率倒谱系数(MFCC)用于特征提取。此外,本研究通过广泛分析评估了六种略有不同的模型架构的性能,并对表现最佳的模型进行了超参数调优。本工作还进行了语言学分析以验证口音和性别准确性,并评估了 AB-1 语料库数据集中的偏差。

关键词

引用

@article{arxiv.2408.06804,
  title  = {Deep Learning for Speaker Identification: Architectural Insights from AB-1 Corpus Analysis and Performance Evaluation},
  author = {Matthias Bartolo},
  journal= {arXiv preprint arXiv:2408.06804},
  year   = {2024}
}

备注

Resultant work from Assignment, Department of AI, University of Malta. Code available at: https://github.com/mbar0075/Speech-Technology