PathoTune:将视觉基础模型适配于病理学专家任务
计算机视觉与模式识别
2024-07-16 v2 机器学习
摘要
随着自然图像理解迈向预训练-微调时代,病理学影像的研究也在同步演进。尽管当前主要关注点在于预训练病理学基础模型,但如何将基础模型适配到下游任务却鲜有探索。针对下游适配,我们提出存在两种领域差距,即基础-任务差距和任务-实例差距。为弥合这些差距,我们引入了PathoTune,一个旨在通过多模态提示微调,高效地将病理学乃至视觉基础模型适配到病理学特定任务的框架。该框架利用任务特定视觉提示和任务特定文本提示来识别任务相关特征,并结合实例特定视觉提示来编码单个病理图像特征。在多个数据集上,无论是图像块级别还是全切片图像(WSI)级别的结果均表明,其性能优于单模态提示微调方法。值得注意的是,PathoTune促进了自然视觉基础模型向病理学任务的直接适配,其性能远超仅使用简单线性探测的病理学基础模型。代码可在https://github.com/openmedlab/PathoDuet获取。
引用
@article{arxiv.2403.16497,
title = {PathoTune: Adapting Visual Foundation Model to Pathological Specialists},
author = {Jiaxuan Lu and Fang Yan and Xiaofan Zhang and Yue Gao and Shaoting Zhang},
journal= {arXiv preprint arXiv:2403.16497},
year = {2024}
}
备注
MICCAI 2024