中文

基于监督与自监督预训练的声学呼吸/咳嗽/语音信号 COVID-19 检测

音频与语音处理 2022-05-10 v1 声音

摘要

本工作中,我们提出一种基于双向长短期记忆(BiLSTM)网络的 COVID-19 检测方法,利用呼吸/语音/咳嗽信号进行诊断。通过分别使用声学信号训练网络,我们可为三项任务构建独立模型,将其参数平均得到平均模型,再作为各任务 BiLSTM 模型训练的初始化。该初始化方法能显著提升三项任务性能,超越官方基线结果。此外,我们还利用公开的预训练模型 wav2vec2.0,并使用官方 DiCOVA 数据集对其进行预训练。该 wav2vec2.0 模型用于提取声音的高层特征,作为模型输入以替代传统的梅尔频率倒谱系数(MFCC)特征。实验结果表明,将高层特征与 MFCC 特征结合使用可提升性能。为进一步提升性能,我们还采用了静音段去除、幅度归一化和时频掩码等预处理技术。所提检测模型在 DiCOVA 数据集上评估,结果显示我们的方法在融合赛道盲测中取得了 88.44% 的曲线下面积(AUC)分数。

关键词

引用

@article{arxiv.2201.08934,
  title  = {Supervised and Self-supervised Pretraining Based COVID-19 Detection Using Acoustic Breathing/Cough/Speech Signals},
  author = {Xing-Yu Chen and Qiu-Shi Zhu and Jie Zhang and Li-Rong Dai},
  journal= {arXiv preprint arXiv:2201.08934},
  year   = {2022}
}

备注

Accepted by ICASSP 2022