COMPRER:增强医学图像表示的多模态多目标预训练框架
计算机视觉与模式识别
2024-03-18 v1 机器学习
摘要
多模态人工智能 (AI) 在将多样化的医学模态信息组合实现综合健康评估方面取得了显著进展。我们提出了 COMPRER,一种新型的多模态、多目标预训练框架,用于增强医学图像表示、诊断推断和疾病预后。COMPRER 采用多目标训练框架,其中每个目标为模型引入不同的知识。这包括一种多模态损失,用于整合不同成像模态间的信息;时间序列损失赋予对时间内模式变化的辨识能力;医学指标预测添加适当的医学见解;最后,重建损失确保潜空间中图像结构的完整性。尽管多个目标可能会削弱任务性能,但我们的发现表明,这种组合实际上在某些任务上提升了结果。我们将该框架应用于视网膜底图像和颈动脉超声,并通过预测当前和未来心血管疾病状况来验证下游任务能力。COMPRER 在 held-out 数据上对医学状况的 AUC 分数高于现有模型。即便在数据量为 COMPRER 训练的 75 倍的 Out-of-distribution (OOD) UK-Biobank 数据集上,COMPRER 仍能保持比拥有更多参数且在更多数据上训练的成熟模型更好的性能。此外,为更好地评估我们模型在对比学习中的表现,我们引入了一种新型评估指标,提供了对潜空间配对效果的更深入理解。
引用
@article{arxiv.2403.09672,
title = {COMPRER: A Multimodal Multi-Objective Pretraining Framework for Enhanced Medical Image Representation},
author = {Guy Lutsker and Hagai Rossman and Nastya Godiva and Eran Segal},
journal= {arXiv preprint arXiv:2403.09672},
year = {2024}
}