中文

基于发声呼吸声的性别分类

音频与语音处理 2023-05-26 v2

摘要

已知连续语音等发声语音信号具有基频(F0)和共振峰频率(F1, F2, F3)等声学特征,可用于性别分类。然而,由于缺乏典型的性别特异性声学特征,利用发声呼吸声等非语音信号进行性别分类的研究尚未得到探索。在本工作中,我们探讨了发声呼吸声是否编码了性别信息,以及若编码了,其能在多大程度上用于自动性别分类。在本研究中,我们探索了使用发声呼吸声的数据驱动特征与基于知识的特征,以及用于性别分类的分类器复杂度。我们还探讨了用于自动分类的呼吸信号段的位置与持续时间的重要性。基于54.23分钟男性与51.83分钟女性呼吸声的实验表明,基于知识的特征(即MFCC统计量)配合低复杂度分类器的表现,与数据驱动特征配合高复杂度分类器的表现相当。研究发现,平均持续时间为3秒的呼吸段是最佳选择,且不受位置影响,从而避免了对呼吸周期边界进行标注的需要。

关键词

引用

@article{arxiv.2211.06371,
  title  = {Vocal Breath Sound Based Gender Classification},
  author = {Mohammad Shaique Solanki and Ashutosh M Bharadwaj and Jeevan K and Prasanta Kumar Ghosh},
  journal= {arXiv preprint arXiv:2211.06371},
  year   = {2023}
}

备注

Some updates in the paper. Will new version after updares