用于自回归合成与理解的统一医学图像标记器
图像与视频处理
2026-04-02 v2 计算机视觉与模式识别
摘要
自回归建模推动了多模态AI的重大进步,但其在医学成像领域的应用受限于缺乏能够同时保持细粒度解剖结构和跨异构模态丰富临床语义的统一图像标记器。现有方法联合优化图像重建和文本语义目标,依赖大规模图像-标题配对数据,容易出现梯度干扰。在医学领域,配对数据稀缺而大量未配对图像却未被充分利用。本工作识别了构建统一医学图像标记器中的这些问题,提出了以视觉表示作为桥梁的原则化两阶段训练框架。提出的视觉表示对齐阶段使我们能够利用大规模未配对医学图像以确保重建保真度并建立基础语义,减轻干扰并更好地为第二个阶段做好准备,在第二个阶段中通过图像-文本配对数据注入细粒度文本语义。得到的标记器MedITok是在超过3300万张医学图像(涵盖9种模态)和200万张图像-文本配对数据上训练的。MedITok在覆盖9种成像模态和4个任务家族的30多个基准测试上实现了最先进的性能。它进一步支持诊断和生成应用的自回归建模,作为面向未来具备统一合成与理解能力的医学领域多模态模型的可扩展组件。项目页面:https://github.com/Masaaki-75/meditok
引用
@article{arxiv.2505.19225,
title = {Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding},
author = {Chenglong Ma and Yuanfeng Ji and Jin Ye and Zilong Li and Chenhui Wang and Junzhi Ning and Wei Li and Lihao Liu and Qiushan Guo and Tianbin Li and Junjun He and Hongming Shan},
journal= {arXiv preprint arXiv:2505.19225},
year = {2026}
}