中文

将任意数据作为图像:融合多模态和不规则时间间隔患者数据的Vision Transformer

计算机视觉与模式识别 2025-01-31 v1 人工智能

摘要

患者在每次住院期间都会接受多项检查,每项检查提供了关于健康状态的不同方面信息。这些评估包括采样率不同的时间数据、离散的单点测量、如药物给药等治疗干预,以及影像学检查。尽管医生能够直观地处理和整合多种模态信息,但神经网络需要针对每种模态进行特定建模,从而 complicating 训练过程。我们演示,通过将所有信息可视化为图像并结合非结构化文本,随后训练常规的视觉-文本Transformer,从而显著降低了复杂度。我们的 метод(Vision Transformer for irregular sampled Multi-modal Measurements, ViTiMM)不仅简化了数据预处理和建模,还在预测住院死亡率和表型分层方面超越了当前的SOTA方法,评估基于来自MIMIC-IV数据集的6175名患者。所涉及的模态包括患者的临床测量、药物、X光影像及心电图扫描。我们希望我们的工作能启发多模态医学AI的进一步发展,通过将训练复杂度降低到(视觉)prompt工程层面,从而降低进入门槛,实现无代码训练。源代码将公开发布。

关键词

引用

@article{arxiv.2501.18237,
  title  = {Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers},
  author = {Malte Tölle and Mohamad Scharaf and Samantha Fischer and Christoph Reich and Silav Zeid and Christoph Dieterich and Benjamin Meder and Norbert Frey and Philipp Wild and Sandy Engelhardt},
  journal= {arXiv preprint arXiv:2501.18237},
  year   = {2025}
}