面向声学场景与呼吸音分类的鲁棒深度学习框架
声音
2021-07-21 v1 音频与语音处理
摘要
本论文致力于处理声学场景分类(ASC)任务,并将为 ASC 开发的技术应用于检测呼吸系统疾病的实际场景中。为应对 ASC 挑战,本论文针对直接影响 ASC 系统性能的三个主要因素展开研究。首先,本论文通过利用多种谱图(log-mel、Gamma 与 CQT)进行低级特征提取,探索输入特征,以解决输入特征判别性或描述性不足的问题。接着,引入一种新颖的编码器(Encoder)网络架构。该编码器首先将每个低级谱图转换为高级中间特征或嵌入(embeddings),进而组合这些高级特征以形成极具区分度的复合特征。随后,使用不同的解码器(Decoder),如随机森林(RF)、多层感知机(MLP)与混合专家(MoE),对该复合或组合特征进行分类性能探究。通过采用此编码器-解码器框架,有助于降低采用多谱图输入的 ASC 系统中参考过程的计算成本。鉴于所提出的针对通用 ASC 任务的技术被证明极为有效,这启发了其向特定实际应用场景的拓展。具体而言,即 2017 年国际生物医学健康信息学会议(ICBHI)呼吸音数据集。在所提 ASC 框架基础上,采用深度学习框架处理 ICBHI 任务,所得系统被证明能够检测呼吸异常周期与疾病。
引用
@article{arxiv.2107.09268,
title = {Robust Deep Learning Frameworks for Acoustic Scene and Respiratory Sound Classification},
author = {Lam Pham},
journal= {arXiv preprint arXiv:2107.09268},
year = {2021}
}