利用自监督特征提取器与注意力机制从语音中自动检测 COVID-19
音频与语音处理
2021-07-02 v1 声音
摘要
ComParE 2021 COVID-19 语音子挑战赛为从语音中自动检测 COVID-19 的评估提供了测试平台。此类模型可与传统检测方法协同工作,为卫生当局提供检测分诊能力,从而具有应用价值。本文中,我们利用预训练的、与任务无关的语音表征,并评估其在该任务上的使用效果。我们将所得结果与从头训练的 CNN 架构以及传统的频域表征进行比较。我们还评估了使用自注意力池化(Self-Attention Pooling)作为语句级信息聚合方法。实验结果表明,在自监督模型提取的特征上训练的模型表现与全监督模型和基于手工特征的模型相当或优于它们。我们的最佳模型在仅由全频带样本组成的开发集上将非加权平均召回率(UAR)从 69.0% 提升至 72.3%,并在测试集上达到 64.4%。此外,我们研究了网络所关注的区域,试图就其可解释性得出一些结论。在这一相对较小的数据集中,我们发现网络特别关注元音和送气音。
引用
@article{arxiv.2107.00112,
title = {Using Self-Supervised Feature Extractors with Attention for Automatic COVID-19 Detection from Speech},
author = {John Mendonça and Rubén Solera-Ureña and Alberto Abad and Isabel Trancoso},
journal= {arXiv preprint arXiv:2107.00112},
year = {2021}
}
备注
Submitted to Interspeech2021