基于监督与自监督预训练的声学呼吸/咳嗽/语音信号 COVID-19 检测
音频与语音处理
2022-05-10 v1 声音
摘要
本工作中,我们提出一种基于双向长短期记忆(BiLSTM)网络的 COVID-19 检测方法,利用呼吸/语音/咳嗽信号进行诊断。通过分别使用声学信号训练网络,我们可为三项任务构建独立模型,将其参数平均得到平均模型,再作为各任务 BiLSTM 模型训练的初始化。该初始化方法能显著提升三项任务性能,超越官方基线结果。此外,我们还利用公开的预训练模型 wav2vec2.0,并使用官方 DiCOVA 数据集对其进行预训练。该 wav2vec2.0 模型用于提取声音的高层特征,作为模型输入以替代传统的梅尔频率倒谱系数(MFCC)特征。实验结果表明,将高层特征与 MFCC 特征结合使用可提升性能。为进一步提升性能,我们还采用了静音段去除、幅度归一化和时频掩码等预处理技术。所提检测模型在 DiCOVA 数据集上评估,结果显示我们的方法在融合赛道盲测中取得了 88.44% 的曲线下面积(AUC)分数。
引用
@article{arxiv.2201.08934,
title = {Supervised and Self-supervised Pretraining Based COVID-19 Detection Using Acoustic Breathing/Cough/Speech Signals},
author = {Xing-Yu Chen and Qiu-Shi Zhu and Jie Zhang and Li-Rong Dai},
journal= {arXiv preprint arXiv:2201.08934},
year = {2022}
}
备注
Accepted by ICASSP 2022