OWT:医学影像的基础器官级分词框架
计算机视觉与模式识别
2025-11-21 v2
摘要
近期表征学习进步往往依赖整体嵌入,将多个语义组件交织在一起,限制了可解释性和泛化能力。这些问题在医学影像中尤为关键,下游任务依赖解语义特征。为克服这些限制,我们提出器官级分词(OWT)框架,采用基于 Token 组的重构(TGR)训练范式。与常规方法不同,OWT 显式地将图像解分为可分离的 Token 组,每组对应于 distinct 器官或语义实体。我们的设计确保每个 Token 组封装器官特定信息,提升可解释性、泛化性和效率,同时实现针对特定临床应用的细粒度控制。CT 和 MRI 数据集上的实验表明,OWT 的强大性能:它不仅在标准任务(如图像重构和分割)中取得优异成绩,还解锁了包括器官特定肿瘤识别、器官级检索和语义级生成于内的诸多新型高影响临床能力,无需额外训练。这些发现凸显了 OWT 作为语义解耦表征学习基础框架的潜力,具备广泛的可扩展性,为如何利用表征提供了新视角。
引用
@article{arxiv.2505.04899,
title = {OWT: A Foundational Organ-Wise Tokenization Framework for Medical Imaging},
author = {Sifan Song and Siyeop Yoon and Pengfei Jin and Sekeun Kim and Matthew Tivnan and Yujin Oh and Runqi Meng and Ling Chen and Zhiliang Lyu and Dufan Wu and Ning Guo and Xiang Li and Quanzheng Li},
journal= {arXiv preprint arXiv:2505.04899},
year = {2025}
}