通过报告文本引导监督提升基于医学图像的癌症检测
计算机视觉与模式识别
2024-05-24 v1 人工智能
计算与语言
摘要
缺乏足够充分的专家级肿瘤标注阻碍了基于监督学习的医学影像机会性癌症筛查的有效性。临床报告(富含描述性文本细节)可以提供“免费午餐”监督信息,并提供肿瘤位置作为弱标签来应对筛查任务,从而节省人工标注工作量(如果适当利用)。然而,仅使用此类弱标签预测癌症可能非常具有挑战性,因为与整个3D医学扫描相比,肿瘤通常出现在较小的解剖区域。弱半监督学习(WSSL)利用有限数量的体素级肿瘤标注,并结合大量仅附带现成临床报告的医学图像,这可能在最小化专家标注工作量和优化筛查效果之间取得良好平衡。在本文中,我们提出了一种新颖的文本引导学习方法,以实现高精度的癌症检测结果。通过将诊断和肿瘤位置文本提示集成到视觉语言模型(VLM)的文本编码器中,可以在VLM的潜在空间中有效优化弱监督学习,从而增强训练的稳定性。我们的方法可以利用大规模预训练VLM的临床知识来增强泛化能力,并生成可靠的伪肿瘤掩模以改进癌症检测。我们在一个包含1,651名独特患者的大规模癌症数据集上的广泛定量实验结果验证了,我们的方法可以减少至少70%的人工标注工作,同时保持与竞争性全监督方法相当的癌症检测准确性(AUC值0.961对比0.966)。
引用
@article{arxiv.2405.14230,
title = {Boosting Medical Image-based Cancer Detection via Text-guided Supervision from Reports},
author = {Guangyu Guo and Jiawen Yao and Yingda Xia and Tony C. W. Mok and Zhilin Zheng and Junwei Han and Le Lu and Dingwen Zhang and Jian Zhou and Ling Zhang},
journal= {arXiv preprint arXiv:2405.14230},
year = {2024}
}