中文

探索用于心脏杂音检测的预训练通用音频表示

音频与语音处理 2024-04-29 v1 声音

摘要

为了减少对熟练临床医生解读心音的需求,近期关于自动化心脏听诊的研究探索了深度学习方法。然而,尽管深度学习对大量数据有需求,但心音数据集的规模有限,且没有可用的预训练模型。相反,许多用于通用音频任务的预训练模型可作为通用音频表示使用。本研究探索了在大规模数据集上预训练的通用音频表示在心脏杂音检测中用于迁移学习的潜力。在 CirCor DigiScope 心音数据集上的实验表明,最近的自监督学习 Masked Modeling Duo (M2D) 以 0.832 的加权准确率和 0.713 的未加权平均召回率优于先前的方法。实验进一步证实,将 M2D 与其他模型集成可提升性能。这些结果证明了通用音频表示在处理心音方面的有效性,并为进一步应用开辟了道路。我们的代码可在线获取,可在 24 GB 消费级 GPU 上运行:https://github.com/nttcslab/m2d/tree/master/app/circor

关键词

引用

@article{arxiv.2404.17107,
  title  = {Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection},
  author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Kunio Kashino},
  journal= {arXiv preprint arXiv:2404.17107},
  year   = {2024}
}

备注

4 pages, 1 figure, and 4 tables. Accepted by IEEE EMBC 2024