中文

结合耳蜗图与视觉Transformer的附加音分类

音频与语音处理 2024-11-12 v1 信号处理

摘要

早期识别呼吸不规则性对于改善肺部健康和降低全球死亡率至关重要。呼吸声音的分析在表征呼吸系统状态和识别异常方面发挥着重要作用。本研究的主要贡献在于探讨当输入数据表示为耳蜗图时,将其输入视觉Transformer架构的性能,因为据我们所知,这种输入-分类器组合首次应用于附加音分类。尽管ViT在音频分类任务中已通过自注意力应用于频谱图块展现出前景,我们通过应用耳蜗图扩展了这一方法,耳蜗图能够捕捉附加音的特定频谱-时序特征。所提出的方法在ICBHI数据集上进行了评估。我们将ViT的分类性能与其他最先进的CNN方法进行了比较,这些方法分别使用频谱图、梅尔频率倒谱系数、常数Q变换和耳蜗图作为输入数据。我们的结果证实了耳蜗图与ViT结合所带来的优越分类性能,突显了ViT在可靠呼吸音分类中的潜力。本研究为开发自动智能技术的持续努力做出了贡献,旨在显著提升呼吸疾病检测的速度和有效性,从而满足医学领域的迫切需求。

关键词

引用

@article{arxiv.2411.05955,
  title  = {Classification of Adventitious Sounds Combining Cochleogram and Vision Transformers},
  author = {Loredana Daria Mang and Francisco David Gonzalez Martinez and Damian Martinez Munoz and Sebastian Garcia Galan and Raquel Cortina},
  journal= {arXiv preprint arXiv:2411.05955},
  year   = {2024}
}