中文

BTS:桥接文本和声音模态用于元数据辅助的呼吸音分类

声音 2024-06-17 v2 人工智能 音频与语音处理

摘要

呼吸音分类(RSC)由于不同的声学特征而具有挑战性,这些特征主要受患者人口统计信息和记录环境的影响。为了解决这个问题,我们引入了一个文本-音频多模态模型,该模型利用呼吸音的元数据,为RSC提供了有用的补充信息。具体来说,我们使用从声音样本元数据(包括患者的性别和年龄、记录设备类型以及记录在患者身体上的位置)派生的自由文本描述,微调了一个预训练的文本-音频多模态模型。我们的方法在ICBHI数据集上实现了最先进的性能,以1.17%的显著幅度超过了先前的最佳结果。这一结果验证了利用元数据和呼吸音样本增强RSC性能的有效性。此外,我们研究了在元数据部分不可用的情况下的模型性能,这种情况可能发生在现实世界的临床环境中。

关键词

引用

@article{arxiv.2406.06786,
  title  = {BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification},
  author = {June-Woo Kim and Miika Toikkanen and Yera Choi and Seoung-Eun Moon and Ho-Young Jung},
  journal= {arXiv preprint arXiv:2406.06786},
  year   = {2024}
}

备注

Accepted INTERSPEECH 2024