超越像素模拟:基于诊断语义令牌和原型控制的病理图像生成
计算机视觉与模式识别
2026-02-27 v2
摘要
在计算病理学中,理解与生成沿着不同的路径发展:先进的理解模型已经展现出诊断级别的能力,而生成模型则主要模拟像素。进展受到三个相互关联因素的阻碍:大规模高质量图像-文本语料库的稀缺;缺乏精确、细粒度的语义控制,这迫使依赖非语义线索;以及术语异质性,即同一诊断概念的不同表述阻碍了可靠的文本条件控制。我们引入了 UniPath,这是一个语义驱动的病理图像生成框架,它利用成熟的诊断理解能力来实现可控生成。UniPath 实现了多流控制:一个原始文本流;一个高层语义流,该流使用可学习查询向冻结的病理 MLLM 提取具有释义鲁棒性的诊断语义令牌,并将提示扩展为诊断感知的属性包;以及一个原型流,该流通过原型库提供组件级的形态学控制。在数据方面,我们整理了一个 265 万张图像的文本-图像语料库和一个精细标注的高质量 6.8 万张图像子集,以缓解数据稀缺问题。为了进行全面评估,我们建立了一个针对病理学量身定制的四级评估体系。大量实验证明了 UniPath 的最先进性能,包括 Patho-FID 达到 80.9(比第二名好 51%),以及细粒度语义控制达到真实图像的 98.7%。数据集和代码可从 https://github.com/Hanminghao/UniPath 获取。
引用
@article{arxiv.2512.21058,
title = {Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control},
author = {Minghao Han and Yichen Liu and Yizhou Liu and Zizhi Chen and Jingqun Tang and Xuecheng Wu and Dingkang Yang and Lihua Zhang},
journal= {arXiv preprint arXiv:2512.21058},
year = {2026}
}
备注
accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables