中文

CaReAQA:一个用于开放式诊断推理的心肺音频问答模型

机器学习 2025-06-03 v2

摘要

心音和肺音等医学音频信号在临床诊断中起着至关重要的作用。然而,分析这些信号仍然具有挑战性:传统方法依赖于手工设计的特征或需要大量标注数据集的监督式深度学习模型,这限制了它们的可扩展性和适用性。为了解决这些问题,我们提出了 CaReAQA,这是一个将基础音频模型与大型语言模型的推理能力相结合的音频-语言模型,能够生成临床相关的开放式诊断响应。与 CaReAQA 一同,我们引入了 CaReSound,这是一个包含丰富元数据和成对问答示例的标注医学音频基准数据集,旨在推动诊断推理研究的进展。评估结果显示,CaReAQA 在开放式诊断推理任务上达到了 86.2% 的准确率,优于基线模型。它还能很好地泛化到封闭式分类任务,在未见过的数据集上平均准确率达到 56.9%。我们的发现展示了音频-语言集成与推理如何推动医学诊断的进步,为临床决策支持提供高效的 AI 系统。

关键词

引用

@article{arxiv.2505.01199,
  title  = {CaReAQA: A Cardiac and Respiratory Audio Question Answering Model for Open-Ended Diagnostic Reasoning},
  author = {Tsai-Ning Wang and Lin-Lin Chen and Neil Zeghidour and Aaqib Saeed},
  journal= {arXiv preprint arXiv:2505.01199},
  year   = {2025}
}

备注

Accepted at AHLI CHIL 2025