StethoLM:面向临床任务的心肺听诊音频语言模型
机器学习
2026-03-03 v1 声音
音频与语音处理
摘要
听诊心脏和肺部听诊音(听诊)是临床检查中最基本的步骤之一。尽管这种方法快速且无创,但仍需数年经验才能解读细微的音频线索。近期的深度学习方法在自动化心肺听诊分析方面取得了进展,但大多仅限于简单分类,且缺乏临床可解释性和决策支持。我们提出了 StethoLM,是首个专为心肺听诊设计的音频-语言模型,能够在完整的听诊分析范畴内执行指令驱动的临床任务。StethoLM 将音频编码与医学语言模型主干相结合,并在 StethoBench 上进行训练——该综合基准包含 77,027 条指令-响应对,源自 16,125 例标记的心肺录音,涵盖七个临床任务类别:二元分类、检测、报告、推理、差别诊断、比较和定位分析。通过多阶段训练结合监督微调和直接偏好优化,StethoLM 在离群数据上的性能和鲁棒性实现了显著提升。我们的工作为临床听诊中的指令遵循 AI 系统奠定了基础。
关键词
引用
@article{arxiv.2603.00355,
title = {StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks},
author = {Yishan Wang and Tsai-Ning Wang and Mathias Funk and Aaqib Saeed},
journal= {arXiv preprint arXiv:2603.00355},
year = {2026}
}
备注
To be published in TMLR