中文

利用多种特征提取技术在伪装语音情感状态下进行说话人识别的探究

声音 2021-12-16 v1 计算与语言 音频与语音处理

摘要

由于人工智能的进步,说话人识别(SI)技术带来了重大方向并已广泛应用于多种领域。SI 最重要的组成部分之一是特征提取,其对 SI 过程与性能有实质影响。因此,众多特征提取策略被深入调研、对比与分析。本文利用五种不同的特征提取方法,针对情感环境下的伪装语音进行说话人识别。为显著评估此工作,使用了三种效应:高音、低音与电子语音转换(EVC)。实验结果表明,拼接的梅尔频率倒谱系数(MFCCs)、MFCCs-delta 与 MFCCs-delta-delta 是最佳的特征提取方法。

关键词

引用

@article{arxiv.2112.07940,
  title  = {The exploitation of Multiple Feature Extraction Techniques for Speaker Identification in Emotional States under Disguised Voices},
  author = {Noor Ahmad Al Hindawi and Ismail Shahin and Ali Bou Nassif},
  journal= {arXiv preprint arXiv:2112.07940},
  year   = {2021}
}

备注

5 pages, 1 figure, accepted in the 14th International Conference on Developments in eSystems Engineering, 7-10 December, 2021