基于 Transformer 的层次化融合网络用于多模态音频疾病预测
声音
2024-12-17 v2 人工智能
机器学习
音频与语音处理
摘要
音频疾病预测正在成为传统医疗诊断方法的有前景的补充,促进早期、便捷且无创的疾病检测和预防。多模态融合将来自各种生物声学模态中特征域的特征整合在一起,已被证明在增强诊断性能方面效果显著。然而,现有大多数方法采用单向融合策略,仅专注于单模态内或跨模态融合。这种方法限制了对多样化声学特征域和生物声学模态互补性质的充分利用。此外,对潜在依赖项在模态特定空间和模态共享空间中不充分且孤立的探索也限制了其处理多模态数据内在异质性的能力。为填补这些差距,我们提出了一个为通用多模态音频疾病预测设计的基于 Transformer 的层次化融合网络。具体而言,我们以层次化方式无缝整合单模态和跨模态融合,并分别熟练地编码必需的单模态和跨模态互补关联。广泛的实验表明,我们的模型在预测三种疾病(COVID-19、帕金森病和病理性言语功能障碍)方面实现了最先进的性能,展示了其在广泛语境下进行音频疾病预测任务的前景。此外, extensive ablation 研究和定性分析突显了模型各主要组件的显著效益。
引用
@article{arxiv.2410.09289,
title = {Multimodal Audio-based Disease Prediction with Transformer-based Hierarchical Fusion Network},
author = {Jinjin Cai and Ruiqi Wang and Dezhong Zhao and Ziqin Yuan and Victoria McKenna and Aaron Friedman and Rachel Foot and Susan Storey and Ryan Boente and Sudip Vhaduri and Byung-Cheol Min},
journal= {arXiv preprint arXiv:2410.09289},
year = {2024}
}