中文

利用全卷积网络与可视化技术于自发语音的痴呆检测

音频与语音处理 2020-08-18 v1 声音

摘要

本文中,我们利用全卷积网络(FCN)分析自发语音的音频数据以进行痴呆检测。全卷积网络可处理不同长度的语音样本,从而使我们无需手动分割即可分析语音样本。具体而言,我们首先从每位参与者的音频数据获取梅尔频率倒谱系数(MFCC)特征图,并将音频数据上的语音分类任务转化为 MFCC 特征图上的图像分类任务。随后,为解决数据不足问题,我们采用来自 MobileNet 架构与 ImageNet 数据集的预训练骨干卷积神经网络(CNN)模型进行迁移学习。我们进一步构建卷积层,利用大津法生成热力图以实现可视化,使我们理解时序音频段对分类结果的影响。我们证明,我们的分类模型在测试集上达到 66.7%,高于 ADReSS 挑战赛所提供的基线模型的 62.5%。通过可视化技术,我们可评估音频段(如参与者的填充停顿与调查者的重复提问)对分类结果的影响。

关键词

引用

@article{arxiv.2008.07052,
  title  = {Exploiting Fully Convolutional Network and Visualization Techniques on Spontaneous Speech for Dementia Detection},
  author = {Youxiang Zhu and Xiaohui Liang},
  journal= {arXiv preprint arXiv:2008.07052},
  year   = {2020}
}