中文

利用互补信息融合提升说话人识别系统性能

声音 2015-03-19 v2 多媒体

摘要

特征提取作为说话人识别(SI)流程中的前端处理模块,起着重要作用。大多数 SI 系统利用诸如梅尔频率倒谱系数(MFCC)、感知线性预测(PLP)、线性预测倒谱系数(LPCC)等特征来表示语音信号。它们的推导基于语音信号的短时处理,试图捕捉声道信息而忽略了声带的贡献。声带线索在 SI 语境中同样重要,因为诸如基频、残差信号中的相位等信息可以传达重要的说话人特定属性,并与频谱特征集中包含的信息互补。本文提出了一种从 LP 建模的残差信号中提取的新型特征集。这里使用高阶统计矩来寻找残差信号中的非线性关系。为了获得互补性的优势,基于声带的决策得分与基于声道的得分进行融合。在两个公开数据库上的实验结果表明,融合模式系统的性能优于单一频谱特征。

关键词

引用

@article{arxiv.1105.2770,
  title  = {Improving Performance of Speaker Identification System Using Complementary Information Fusion},
  author = {Md. Sahidullah and Sandipan Chakroborty and Goutam Saha},
  journal= {arXiv preprint arXiv:1105.2770},
  year   = {2015}
}

备注

6 Pages, 3 figures