中文

面向开放呼吸声基础模型:预训练与基准测试

声音 2024-11-08 v3 人工智能 机器学习 音频与语音处理

摘要

呼吸音(如咳嗽和呼吸声)具有广泛的医疗应用预测能力,但目前尚未得到充分探索。这些应用的主要问题在于,开发模型所需的大规模标记任务特定数据难以收集。使用无标记数据预训练的通用呼吸声基础模型将提供诱人优势,可能打破这一困境。然而,鉴于医疗应用的安全关键性,确保任何提出的基础模型方案的开放性和可复制性至关重要。为此,我们引入OPERA——一个OPEn Respiratory Acoustic foundation model pretraining and benchmarking system,即首个回应这一需求的方案。我们策划了大规模呼吸声数据集(约13.6万样本,超过400小时),预训练了三个开创性基础模型,并构建了一个由19个下游呼吸健康任务组成的基准测试集。我们的预训练模型在16个19个下游任务中均显示出优于使用通用音频预训练的现有模型的优异性能(优于现有方法),并表现出对未见数据集和新的呼吸声模态的良好泛化能力。这一发现凸显了呼吸声基础模型的巨大潜力,并鼓励更多人使用OPERA作为开放资源来加速围展开呼吸音健康研究。该系统可访问于 https://github.com/evelyn0414/OPERA。

关键词

引用

@article{arxiv.2406.16148,
  title  = {Towards Open Respiratory Acoustic Foundation Models: Pretraining and Benchmarking},
  author = {Yuwei Zhang and Tong Xia and Jing Han and Yu Wu and Georgios Rizos and Yang Liu and Mohammed Mosuily and Jagmohan Chauhan and Cecilia Mascolo},
  journal= {arXiv preprint arXiv:2406.16148},
  year   = {2024}
}

备注

accepted by NeurIPS 2024 Track Datasets and Benchmarks