中文

多模态学习在医疗保健领域何时有效?基于 EHR 和胸片融合的基准测试

机器学习 2026-03-02 v1 人工智能

摘要

机器学习在推动临床决策支持方面具有巨大潜力,但实际情况下何时能够真正发挥多模态学习的优势仍不明确,尤其是在模态缺失和公平性约束下。本文我们在来自 MIMIC-IV 和 MIMIC-CXR 的标准化队列上,系统性地对 EHR(电子健康记录)和胸片(chest X-ray,CXR)之间的多模态融合进行基准测试,旨在回答四个根本性问题:多模态融合在临床预测中何时提升性能、不同融合策略如何比较、现有方法在缺失模态情况下的鲁棒性如何、以及多模态模型是否实现算法公平性。我们的研究揭示了若干关键见解。当模态数据完整时,多模态融合会提升性能, gains集中于那些需要来自 EHR 和 CXR 双方互补信息的疾病。尽管跨模态学习机制捕获了超越简单拼接的临床相关性,但 EHR 丰富的时序结构引入了强大的模态不平衡,单凭架构复杂度难以克服。在现实的缺失情况下,多模态优势会迅速下降,除非模型专门设计用于处理不完整输入。此外,多模态融合本身并不天然地提高公平性,亚组差异主要源于不同人口统计学群体中灵敏度的不均。为支持可重复且可扩展的评估,我们进一步发布了一个灵活的基准工具包,允许即插即用地集成新的模型和数据集。总体而言,本工作为何时、如何以及为何使用多模态学习提供了可操作的指导,为开发既有效又可靠的临床可部署多模态系统奠定了基础。该开源工具包可在 https://github.com/jakeykj/CareBench 查阅。

关键词

引用

@article{arxiv.2602.23614,
  title  = {When Does Multimodal Learning Help in Healthcare? A Benchmark on EHR and Chest X-Ray Fusion},
  author = {Kejing Yin and Haizhou Xu and Wenfang Yao and Chen Liu and Zijie Chen and Yui Haang Cheung and William K. Cheung and Jing Qin},
  journal= {arXiv preprint arXiv:2602.23614},
  year   = {2026}
}