中文

一种用于文本无关说话人识别的新型语音特征融合算法

音频与语音处理 2022-12-02 v1

摘要

本文提出一种结合独立向量分析(IVA)与并行卷积神经网络(PCNN)的新型语音特征融合算法,用于文本无关说话人识别。首先,可从说话人语音中提取时域(TD)特征与频域(FD)特征等不同类型的特征,TD 与 FD 特征可视为独立特征分量(IFCs)在未知混合系统下的线性混合。为估计 IFCs,将说话人语音的 TD 与 FD 特征分别拼接构建 TD 与 FD 特征矩阵,随后通过并行 TD 与 FD 特征矩阵得到说话人语音的特征张量。为增强对不同特征类型的依赖并去除同类特征中的冗余,利用独立向量分析(IVA)基于该特征张量估计 TD 与 FD 特征的 IFC 矩阵。将 IFC 矩阵作为 PCNN 的输入,分别提取 TD 与 FD 特征的深度特征,并将深度特征整合得到说话人语音的融合特征。最后,将融合特征作为深度卷积神经网络(DCNN)分类器的输入用于说话人识别。实验结果表明了所提说话人识别系统的有效性与性能。

关键词

引用

@article{arxiv.2212.00329,
  title  = {A Novel Speech Feature Fusion Algorithm for Text-Independent Speaker Recognition},
  author = {Biao Ma and Chengben Xu and Ye Zhang},
  journal= {arXiv preprint arXiv:2212.00329},
  year   = {2022}
}