使用音频频谱图 Vision Transformer 识别异常呼吸音
声音
2024-05-15 v1 机器学习
音频与语音处理
摘要
呼吸系统疾病是全球第三大死因,被认为是需要对其识别和治疗进行大量研究的高优先级疾病。听诊器记录的肺部声音和人工智能驱动的设备已被用于识别肺部疾病并辅助专家做出准确诊断。在本研究中,开发了一种用于识别异常呼吸音的新方法——音频频谱图 Vision Transformer (AS-ViT)。利用短时傅里叶变换 (STFT) 技术将肺部声音转换为称为频谱图的视觉表示。随后使用 Vision Transformer 模型分析这些图像,以识别不同类型的呼吸音。分类实验使用 ICBHI 2017 数据库进行,该数据库包含具有不同频率、噪声水平和背景的多种类型肺音。所提出的 AS-ViT 方法使用三个指标进行评估,在呼吸音检测方面,对于 60:40 的划分比例,其未加权平均召回率和总体得分分别达到 79.1% 和 59.8%;对于 80:20 的划分比例,分别达到 86.4% 和 69.3%,超越了先前 SOTA 的结果。
引用
@article{arxiv.2405.08342,
title = {Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer},
author = {Whenty Ariyanti and Kai-Chun Liu and Kuan-Yu Chen and Yu Tsao},
journal= {arXiv preprint arXiv:2405.08342},
year = {2024}
}
备注
Published in 2023 45th Annual International Conference of the IEEE Engineering in Medicine & Biology Society (EMBC)