中文

用于呼吸音分类的多视角谱图 transformer

声音 2024-05-31 v3 计算机视觉与模式识别 音频与语音处理

摘要

深度神经网络已被应用于音频谱图以进行呼吸音分类。现有模型常将谱图视为合成图像,却忽视了其物理特性。本文提出一种多视角谱图 Transformer(MVST),将时频特性的不同视角嵌入视觉 transformer。具体而言,所提 MVST 将梅尔谱图分割为不同尺寸的块,代表呼吸音的多视角声学元素。这些块与位置嵌入随后被送入 transformer 编码器,通过自注意力机制提取块间的注意力信息。最后,设计了一种门控融合方案,以自动权衡多视角特征,在特定场景下突出最优特征。在 ICBHI 数据集上的实验结果表明,所提 MVST 在呼吸音分类上显著优于最先进(SOTA)方法。

关键词

引用

@article{arxiv.2311.09655,
  title  = {Multi-View Spectrogram Transformer for Respiratory Sound Classification},
  author = {Wentao He and Yuchen Yan and Jianfeng Ren and Ruibin Bai and Xudong Jiang},
  journal= {arXiv preprint arXiv:2311.09655},
  year   = {2024}
}

备注

The paper was published at ICASSP 2024