中文

用于全面体音听诊的通用音频基础模型

声音 2025-03-26 v2 音频与语音处理

摘要

准确高效的基于听诊的诊断对早期疾病检测至关重要,特别是在专业临床专长稀缺的资源受限环境中。传统听诊高度依赖临床医生经验,存在显著的观察者间变异性,而现有 AI 模型常因非代表性训练数据的局限而失效。本研究介绍了 AuscultaBase,一种新型 AI 驱动的诊断框架,利用自监督和对比学习技术以及大规模多源数据集成来推进体音分析。通过生成鲁棒特征表示,AuscultaBase 显著提升了异常检测、疾病分类和活动识别任务的性能。在我们新建立的基准 AuscultaBench 上的综合评估表明,AuscultaBase 在关键性能指标上持续优于最先进方法,凸显了其作为可扩展且具有成本效益的临床筛查和早期疾病干预工具的潜力。代码和模型检查点已发布在 https://github.com/applewpj/AuscultaBase。

关键词

引用

@article{arxiv.2411.07547,
  title  = {A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation},
  author = {Pingjie Wang and Liudan Zhao and Zihan Zhao and Miao He and Xin Sun and Ya Zhang and Kun Sun and Yanfeng Wang and Yu Wang},
  journal= {arXiv preprint arXiv:2411.07547},
  year   = {2025}
}

备注

31 pages