探索在心杂音特征上微调 Audio-LLM 的能力
音频与语音处理
2025-01-24 v1 人工智能
声音
摘要
大型语言模型(LLM)在识别和分析人类语音、音乐和环境声方面已表现出色,但尽管有着巨大的科学兴趣,其理解其他类型声音的潜力仍基本未被探索。本研究聚焦于使用音频心尿动图(heart sounds)进行心血管疾病诊断。大多数现有的深度神经网络(DNN)范例仅限于心杂音分类(健康 vs 疾病),并且不预测心杂音的其他声学特征,如时机、分级、粗糙度、音高和品质,这些特征对于帮助医生诊断潜在心脏病情至关重要。我们提出在 PhysioNet CirCor DigiScope 心尿动图(PCG)数据集上微调音频 LLM Qwen2-Audio,并评估其在分类 11 个专家标注的心杂音特征方面的性能。此外,我们通过探索使用音频表示模型 SSAMBA 的预处理分段算法来实现更具噪声鲁棒性和更好的可泛化性。我们的结果表明,该 LLM 在 8 个中的 11 个特征上超越了最先进的方法,在其余 3 个特征上表现相当。而且,该 LLM 成功分类了以有限训练数据为目标的长尾心杂音特征,此前的所有方法都未能完成此任务。这一发现凸显了音频 LLM 作为人类心脏科医生助理的潜力,可用于提升心脏病诊断。
引用
@article{arxiv.2501.13884,
title = {Exploring Finetuned Audio-LLM on Heart Murmur Features},
author = {Adrian Florea and Xilin Jiang and Nima Mesgarani and Xiaofan Jiang},
journal= {arXiv preprint arXiv:2501.13884},
year = {2025}
}
备注
5 pages, 1 figure, and 3 tables. Submitted to IEEE/ACM Conference on Connected Health: Applications, Systems , and Engineering Technologies