中文

重新思考多模态:优化用于生物医学信号分类的多模态深度学习

机器学习 2025-08-05 v1 人工智能

摘要

本研究提出了一种关于用于生物医学信号分类的多模态深度学习的新视角,系统分析了互补特征域如何影响模型性能。虽然融合多个域通常被认为能提高准确性,但这项工作表明,添加模态可能产生递减的回报,因为并非所有融合都固有地有利。为了验证这一点,我们设计、开发并严格评估了五个深度学习模型:三个单模态(用于时域的1D-CNN、用于时频域的2D-CNN和用于频域的1D-CNN-Transformer)和两个多模态(混合模型1,融合了1D-CNN和2D-CNN;混合模型2,结合了1D-CNN、2D-CNN和Transformer)。对于心电图(ECG)分类,自助法和贝叶斯推断显示,混合模型1在所有指标上始终优于2D-CNN基线(p值 < 0.05,贝叶斯概率 > 0.90),证实了时域和时频域的协同互补性。相反,混合模型2引入频域并未带来进一步改进,有时甚至略有下降,表明存在表示冗余;这一现象通过有针对性的消融研究得到了进一步证实。这项研究重新定义了生物医学信号分析中多模态设计的基本原则。我们证明,最优的域融合不在于模态的数量,而在于其内在互补性的质量。这一范式转变的概念超越了纯粹启发式的特征选择。我们新颖的理论贡献——“多模态ECG深度学习中的互补特征域”——提出了一个可数学量化的框架,用于识别理想的域组合,证明最优的多模态性能源于融合域之间内在的信息论互补性。

关键词

引用

@article{arxiv.2508.00963,
  title  = {Rethinking Multimodality: Optimizing Multimodal Deep Learning for Biomedical Signal Classification},
  author = {Timothy Oladunni and Alex Wong},
  journal= {arXiv preprint arXiv:2508.00963},
  year   = {2025}
}