中文

利用多模态联合嵌入预测架构学习影像和临床特征

计算机视觉与模式识别 2025-09-22 v1 人工智能

摘要

多模态模型用于肺结节诊断的发展受到标注数据稀缺和模型在训练分布上过拟合倾向的限制。本文利用纵向和多模态档案进行自监督学习,以解决上述挑战。我们策划了一组来自本机构的CT扫描和关联电子健康记录的无标签患者数据,以为联合嵌入预测架构(JEPA)预训练提供动力。在监督微调后,我们展示了该方法在内部队列中优于无规则化的多模态模型和仅影像的模型(本方法: 0.91, 多模态: 0.88, 仅影像: 0.73 AUC),但在外部队列中表现不佳(本方法: 0.72, 仅影像: 0.75 AUC)。我们开发了一个合成环境,以刻画JEPA可能不表现的情境。本工作创新了一种利用无标签多模态医疗档案以提高预测模型性能的 approach,并展示了其在肺结节诊断中的优势与局限。

关键词

引用

@article{arxiv.2509.15470,
  title  = {Self-supervised learning of imaging and clinical signatures using a multimodal joint-embedding predictive architecture},
  author = {Thomas Z. Li and Aravind R. Krishnan and Lianrui Zuo and John M. Still and Kim L. Sandler and Fabien Maldonado and Thomas A. Lasko and Bennett A. Landman},
  journal= {arXiv preprint arXiv:2509.15470},
  year   = {2025}
}