中文

利用声学特征对佩戴与未佩戴口罩的语音进行分类

音频与语音处理 2020-10-09 v1 声音

摘要

对语音的理解和解释可能受到多种外部因素的影响。佩戴口罩就是其中之一,它会在交流时对语音产生阻碍。这可能导致语音处理性能下降,并在感知上影响人类。了解说话人是否佩戴口罩对于为不同应用进行语音建模可能是有用的。基于此动机,从给定语音中判断说话人是否佩戴口罩被作为计算副语言评测 2020 的一项任务。我们研究了基于线性滤波器组、瞬时相位和长时信息的新型声学特征,这些特征能够捕捉用于分类佩戴与未佩戴口罩语音的伪影。这些声学特征与 ComParE 2020 的最先进基线(即 ComParE functionals、bag-of-audio-words、DeepSpectrum 和 auDeep 特征)结合使用。研究表明了这些声学特征的有效性,并且它们与 ComParE 2020 基线的分数级融合在测试集上实现了 73.50% 的未加权平均召回率。

关键词

引用

@article{arxiv.2010.03907,
  title  = {Classification of Speech with and without Face Mask using Acoustic Features},
  author = {Rohan Kumar Das and Haizhou Li},
  journal= {arXiv preprint arXiv:2010.03907},
  year   = {2020}
}

备注

Accepted for publication in APSIPA ASC 2020