中文

ENACT-Heart:基于 CNN 和 Transformer 集成的心音评估

声音 2025-02-25 v1 人工智能 音频与语音处理

摘要

本研究探讨了 Vision Transformer (ViT) 原理在音频分析中的应用,特别聚焦于心音。本文提出了 ENACT-Heart——一种新颖的集成方法,通过混合专家 (MoE) 框架利用卷积神经网络 (CNN) 和 ViT 的互补优势,实现了 97.52% 的显著分类准确率。这优于 ViT (93.88%) 和 CNN (95.45%) 的单独贡献,展示了在心血管健康监测中提高诊断准确性的潜力。这些结果证明了集成方法在增强心血管健康监测和诊断分类性能方面的潜力。

关键词

引用

@article{arxiv.2502.16914,
  title  = {ENACT-Heart -- ENsemble-based Assessment Using CNN and Transformer on Heart Sounds},
  author = {Jiho Han and Adnan Shaout},
  journal= {arXiv preprint arXiv:2502.16914},
  year   = {2025}
}

备注

Accepted but not published in Global Digital Health Knowledge Exchange & Empowerment Conference (gDigiHealth.KEE)