中文

RespLLM:用于通用呼吸健康预测的统一音频与文本多模态大语言模型

机器学习 2024-10-10 v1 人工智能 声音 音频与语音处理

摘要

与呼吸疾病相关的高发病率和高死亡率凸显了早期筛查的重要性。机器学习模型可以自动化临床诊断和听诊,为这一领域提供必要支持。然而,涉及的人口学信息、病史、症状和呼吸音频等数据是异构且复杂的。现有方法不足且缺乏通用性,因为它们通常依赖有限的训练数据、基本的融合技术和任务特定模型。本文提出了 RespLLM,一种新的多模态大语言模型(LLM)框架,用于统一音频和文本表示,以实现呼吸健康预测。RespLLM 利用预训练大语言模型所拥有的广泛先验知识,并通过跨模态注意力机制实现有效的音频-文本融合。采用指令微调将来自多个来源的多样化数据整合,确保模型的通用性和灵活性。在五个真实世界数据集上的实验表明,RespLLM 在训练任务上比领先基线提高平均 4.6%,在未见数据集上提高 7.9%,并能为新任务提供零样本预测。我们的工作为能够感知、倾听和理解异构数据的多模态模型奠定了基础,为可扩展的呼吸健康诊断铺平了道路。

关键词

引用

@article{arxiv.2410.05361,
  title  = {RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction},
  author = {Yuwei Zhang and Tong Xia and Aaqib Saeed and Cecilia Mascolo},
  journal= {arXiv preprint arXiv:2410.05361},
  year   = {2024}
}