中文

基于In-Context扩散变换器的布局引导可控病理图像生成

计算机视觉与模式识别 2026-03-17 v1

摘要

可控病理图像合成需要可靠地调节空间布局、组织形态和语义细节。然而,现有文本引导的扩散模型仅提供粗略的全局控制,缺乏强制细粒度结构约束的能力。进一步受限于缺乏大规模数据集将patch级空间布局与详细诊断描述配对,因为为全切片巨图人工标注需耗费大量时间。为克服这些挑战,我们首先开发了一个可扩展的多代理LVLM标注框架,将图像描述、诊断步骤提取和自动质量判断集成到协调管道中,并通过人类验证过程评估系统可靠性。该框架高效构建了细粒度且临床对齐的监督数据。基于筛选后的数据,我们提出In-Context扩散变换器(IC-DiT),一种布局感知的生成模型,将空间布局、文本描述和视觉嵌入整合到统一的扩散变换器中。通过层次化多模态注意力,IC-DiT保持全局语义一致性,同时准确保留结构和形态细节。广泛实验表明,IC-DiT在五个组织病理数据集上实现更高的保真度、更强的空间可控性和更好的诊断一致性,优于现有方法。此外,生成的图像作为有效的数据增强资源可用于下游任务,如癌症分类和生存分析。

关键词

引用

@article{arxiv.2603.13386,
  title  = {Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers},
  author = {Yuntao Shou and Xiangyong Cao and Qian Zhao and Deyu Meng},
  journal= {arXiv preprint arXiv:2603.13386},
  year   = {2026}
}

备注

19 pages