AutoRad-Lung:面向肺结节恶性预测的基于放射组学引导的自回归视觉语言模型
计算机视觉与模式识别
2025-03-27 v1 机器学习
图像与视频处理
摘要
肺癌是全球癌症死亡原因的首要原因之一。早期诊断的关键挑战在于区分视觉特征相似且标注得分相近的不确定案例。在临床实践中,放射科医生依赖从CT图像中提取的定量、手工放射组学特征,而近期研究主要关注深度学习解决方案。更近期,特别是基于对比语言图像预训练(CLIP)的视觉语言模型(VLM)因其整合文本知识在肺癌诊断中受到关注。尽管CLIP-Lung模型显示出有前景的成果,但我们识别出以下潜在局限性:(a)依赖放射科医生标注的属性,这些属性本质上是主观且易出错的;(b)仅在训练期间使用文本信息,限制了推理时的直接适用性;(c)基于卷积的视觉编码器使用随机初始化的权重,忽略了先验知识。为此,我们引入AutoRad-Lung,将自回归预训练VLM与来自手工放射组学的提示一起耦合。AutoRad-Lung使用大规模自回归图像模型(AIMv2)的视觉编码器进行预训练,目标是多模态自回归。鉴于肿瘤通常小且形状不规则,且视觉上类似于健康组织,AutoRad-Lung在捕获像素级差异方面优于其CLIP-based对手。此外,我们引入条件上下文优化,动态生成基于输入放射组学的特定上下文提示,提高了跨模态对齐。
引用
@article{arxiv.2503.20662,
title = {AutoRad-Lung: A Radiomic-Guided Prompting Autoregressive Vision-Language Model for Lung Nodule Malignancy Prediction},
author = {Sadaf Khademi and Mehran Shabanpour and Reza Taleei and Anastasia Oikonomou and Arash Mohammadi},
journal= {arXiv preprint arXiv:2503.20662},
year = {2025}
}