医学图像表示学习的放射科医生阅读世界模型
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
放射科医生的眼动数据提供了专家在图像阅读中搜索、比较和积累证据的丰富记录;然而,现有方法仅部分利用这一信号,或作为静态空间先验,或作为与诊断分离的辅助预测目标。我们提出 GazeWorld,一种医学影像世界模型,将图像视为世界,将放射科医生的注视序列视为其中的轨迹。GazeWorld 按序预测下一个注视区域的潜在表示,同时空间完成分支覆盖未访问的区域。在推断时,GazeWorld 可仅凭图像生成一系列区域表示,而无需真实眼动数据。冻结的 GazeWorld 特征在 CheXpert、RSNA 肺炎和 SIIM-ACR 肺气肿病等九个监督设置上实现最先进的诊断准确率,以及在所有三个基准测试上实现最高的零样本准确率。在 GazeSearch 数据集上,基于相同冻结特征训练的通用解码器在 ScanMatch 和 SED 上的准确率分别超过 LogitGaze-Med 16% 和 22%,尽管该解码器未被明确训练以预测眼动。GazeWorld 表明,仅关注专家阅读的结论,而忽略其阅读方式,为医学影像人工智能提供了有前景的预训练范式。
引用
@article{arxiv.2605.23992,
title = {A World Model of Radiologist Reading for Medical Image Representation Learning},
author = {Yiwei Li and Zihao Wu and Huaqin Zhao and Yifan Zhou and Chao Cao and Dajiang Zhu and Tianming Liu and Lin Zhao},
journal= {arXiv preprint arXiv:2605.23992},
year = {2026}
}