检索增强的解剖学引导用于文本到 CT 生成
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
文本条件生成模型用于体积医学成像提供语义控制但缺乏显式解剖学引导,常导致输出在空间上模糊或解剖不一致。相比之下,结构驱动方法确保强解剖一致性,但通常假设访问 ground-truth 标注,而在要合成的目标图像不可得时这几乎不可能。我们提出一种检索增强的方法,用于 Text-to-CT 生成,在真实推断环境下整合语义与解剖学信息。给定放射科报告,我们的方法使用 3D 视觉语言编码器检索一个语义相关的临床病例,并利用其关联解剖标注作为结构代理。该代理通过 ControlNet 分支注入文本条件潜在扩散模型,提供粗略的解剖学引导,同时保持语义灵活性。CT-RATE 数据集上的实验表明,检索增强的生成在图像保真度和临床一致性方面优于文本-only 基线,同时额外实现了显式的空间可控性,这在此类方法中本质上不存在。进一步分析突显检索质量的重要性,语义对齐的代理在所有评估维度上均可一致获益。本工作引入一种原则且可扩展的机制,桥接语义条件与解剖学可信度于体积医学图像合成。代码将发布。
引用
@article{arxiv.2603.08305,
title = {Retrieval-Augmented Anatomical Guidance for Text-to-CT Generation},
author = {Daniele Molino and Camillo Maria Caruso and Paolo Soda and Valerio Guarrasi},
journal= {arXiv preprint arXiv:2603.08305},
year = {2026}
}