中文

面向肾癌精准肿瘤学的疾病导向视觉语言基础模型

图像与视频处理 2025-08-25 v1 人工智能 计算机视觉与模式识别

摘要

对日益发现的肾源性肿瘤进行无创评估是肾脏肿瘤学中的关键挑战,其中诊断不确定性常常导致对良性或温和肿瘤的过度治疗。本研究中,我们开发并验证了 RenalCLIP,这是一个由来自九个中国医疗中心的 27,866 例 CT 扫描(来自 8,809 名患者)以及公开 TCIA 数据集构成的视觉语言基础模型,用于肾瘤的表征、诊断和预后评估。该模型通过两阶段预训练策略实现:首先通过领域特定知识增强图像和文本编码器,然后通过对比学习目标对其进行对齐,以创建稳健的表征,实现更好的泛化和诊断精度。RenalCLIP 在包括解剖学评估、诊断分类和生存预测等 10 项核心任务上的表现优于其他领先的通用 CT 基础模型。尤其在 TCIA 数据集上进行复发风险无复发生存预测任务中,RenalCLIP 达到 C-index 为 0.726,显著优于领先基线方法约 20%。此外,RenalCLIP 的预训练赋予了惊人的数据效率;在诊断分类任务中,它仅需 20% 的训练数据即可达到所有基线模型在使用 100% 数据完全微调后的最佳性能。该模型在报告生成、图像-文本检索和零样诊断等任务上也表现出色。我们的发现表明,RenalCLIP 提供了一个具有潜力的稳健工具,可提高诊断准确性、细化预后分层,并个性化管理肾癌患者。

关键词

引用

@article{arxiv.2508.16569,
  title  = {A Disease-Centric Vision-Language Foundation Model for Precision Oncology in Kidney Cancer},
  author = {Yuhui Tao and Zhongwei Zhao and Zilong Wang and Xufang Luo and Feng Chen and Kang Wang and Chuanfu Wu and Xue Zhang and Shaoting Zhang and Jiaxi Yao and Xingwei Jin and Xinyang Jiang and Yifan Yang and Dongsheng Li and Lili Qiu and Zhiqiang Shao and Jianming Guo and Nengwang Yu and Shuo Wang and Ying Xiong},
  journal= {arXiv preprint arXiv:2508.16569},
  year   = {2025}
}