CheXWorld:探索放射图图像世界建模用于放射图表征学习
计算机视觉与模式识别
2025-04-21 v1
摘要
人类可以发展内部世界模型,对此了解世界的运行机制以及预测其动作的后果。这个概念最近在一些初步工作中被证明是建立通用机器学习模型的有前景的方向,例如用于视觉表征学习。在本文中,我们提出 CheXWorld,这是首个针对放射图图像的自监督世界模型。具体而言,我们的工作开发了一个统一框架,同时建模三个对合格放射科医生至关重要的医学知识方面:1) 描述局部组织细粒度特征的局部解剖结构(例如构成、形状和纹理);2) 描述人体全球组织结构的全局解剖布局(例如器官和骨骼的布局);3) 鼓励 CheXWorld 建模放射图不同外观领域之间的转换(例如由不同医院、设备或患者收集的放射图导致的清晰度、对比度和曝光度的变化)。实验上,我们设计了量化和定性分析,揭示 CheXWorld 成功地捕获了这三个维度的医学知识。此外,跨八个医学图像分类和分割基准的迁移学习实验表明,CheXWorld 显著优于现有的自监督方法和大规模医学基础模型。代码与预训练模型已提供于 https://github.com/LeapLabTHU/CheXWorld。
引用
@article{arxiv.2504.13820,
title = {CheXWorld: Exploring Image World Modeling for Radiograph Representation Learning},
author = {Yang Yue and Yulin Wang and Chenxin Tao and Pan Liu and Shiji Song and Gao Huang},
journal= {arXiv preprint arXiv:2504.13820},
year = {2025}
}
备注
Accepted by CVPR 2025