中文

基于语音的口罩检测与呼吸监测:关于数据增强、特征表示与建模

音频与语音处理 2020-08-17 v2 机器学习 声音

摘要

本文介绍了我们针对 Interspeech COMPARE 2020 挑战赛中口罩与呼吸子挑战赛的方法。对于口罩检测任务,我们使用滤波器组能量、性别感知特征和说话人感知特征训练深度卷积神经网络。支持向量机作为后端分类器用于对提取的深度嵌入进行二分类预测。我们采用多种数据增强方案来增加训练数据量并提升模型的鲁棒性,包括速度扰动、SpecAugment 和随机擦除。对于语音呼吸监测任务,我们基于 Bi-LSTM 结构研究了不同的瓶颈特征。实验结果表明,我们提出的方法优于基线,并在呼吸和口罩评估集上分别取得了 0.746 的 PCC 和 78.8% 的 UAR。

关键词

引用

@article{arxiv.2008.05175,
  title  = {Mask Detection and Breath Monitoring from Speech: on Data Augmentation, Feature Representation and Modeling},
  author = {Haiwei Wu and Lin Zhang and Lin Yang and Xuyang Wang and Junjie Wang and Dong Zhang and Ming Li},
  journal= {arXiv preprint arXiv:2008.05175},
  year   = {2020}
}