中文

通过谐波/打击乐声源分离和卷积神经网络在有限数据集下改进鼾声检测

声音 2024-11-01 v1 人工智能 新兴技术 音频与语音处理 信号处理

摘要

鼾声是一种在阻塞性睡眠呼吸暂停综合征(OSAS)患者中常见的声学生物标志物,对于诊断和监测这一公认的临床疾病具有巨大潜力。无论鼾声类型如何,大多数鼾声实例都表现出可识别的谐波模式,这些模式通过随时间变化的独特能量分布体现出来。在这项工作中,我们提出了一种新方法,通过使用谐波/打击乐声源分离(HPSS)分析输入声音的谐波内容,来区分单声道鼾声和非鼾声。由此产生的基于HPSS谐波谱图的特征被用作常规神经网络架构的输入数据,旨在即使在有限数据学习框架下也能提高鼾声检测性能。为了评估我们提出的方法的性能,我们研究了两种不同的场景:1)使用包含鼾声和干扰声音的大型数据集,以及2)使用由约1%数据材料组成的缩减训练集。在前一种场景中,与文献中的其他输入特征相比,所提出的基于HPSS的特征提供了具有竞争力的结果。然而,所提出方法的关键优势在于,在有限数据学习背景下,从HPSS导出的谐波谱图表现出优越的性能。在这种特定场景下,与现有文献中记载的经典输入特征相比,使用所提出的谐波特征显著增强了所有研究架构的性能。这一发现清楚地表明,即使在训练数据量有限的情况下,融入谐波内容也能更可靠地学习大多数鼾声中普遍存在的基本时频特性。

关键词

引用

@article{arxiv.2410.23796,
  title  = {Improving snore detection under limited dataset through harmonic/percussive source separation and convolutional neural networks},
  author = {F. D. Gonzalez-Martinez and J. J. Carabias-Orti and F. J. Canadas-Quesada and N. Ruiz-Reyes and D. Martinez-Munoz and S. Garcia-Galan},
  journal= {arXiv preprint arXiv:2410.23796},
  year   = {2024}
}