中文

StethoLM:面向临床任务的心肺听诊音频语言模型

机器学习 2026-03-03 v1 声音 音频与语音处理

摘要

听诊心脏和肺部听诊音(听诊)是临床检查中最基本的步骤之一。尽管这种方法快速且无创,但仍需数年经验才能解读细微的音频线索。近期的深度学习方法在自动化心肺听诊分析方面取得了进展,但大多仅限于简单分类,且缺乏临床可解释性和决策支持。我们提出了 StethoLM,是首个专为心肺听诊设计的音频-语言模型,能够在完整的听诊分析范畴内执行指令驱动的临床任务。StethoLM 将音频编码与医学语言模型主干相结合,并在 StethoBench 上进行训练——该综合基准包含 77,027 条指令-响应对,源自 16,125 例标记的心肺录音,涵盖七个临床任务类别:二元分类、检测、报告、推理、差别诊断、比较和定位分析。通过多阶段训练结合监督微调和直接偏好优化,StethoLM 在离群数据上的性能和鲁棒性实现了显著提升。我们的工作为临床听诊中的指令遵循 AI 系统奠定了基础。

关键词

引用

@article{arxiv.2603.00355,
  title  = {StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks},
  author = {Yishan Wang and Tsai-Ning Wang and Mathias Funk and Aaqib Saeed},
  journal= {arXiv preprint arXiv:2603.00355},
  year   = {2026}
}

备注

To be published in TMLR