G2D:基于视觉-语言预训练的从全局到密集 X 射线摄影表征学习
计算机视觉与模式识别
2024-10-28 v4 机器学习
摘要
近期,医学视觉-语言预训练 (VLP) 在从医学图像及其配对的放射学报告中学习全局视觉表征方面取得了重大进展。然而,现实世界中的医学成像任务通常需要视觉特征具有更细的粒度。这些任务包括视觉定位任务(如语义分割、目标检测)和视觉定位任务。然而,当前的医学 VLP 方法在学习这些细粒度特征时面临挑战,因为它们主要侧重于图像块与单个文本 token 之间的暴力对齐以进行局部视觉特征学习,这对于下游密集预测任务是次优的。在这项工作中,我们提出了一种新的 VLP 框架,命名为从全局到密集 (G2D) 级别的表征学习,与现有的医学 VLP 方法相比,它实现了显著改善的粒度和更准确的定位。具体而言,G2D 通过与全局视觉-语言对齐并行的伪分割任务来学习密集且语义上有根据的图像表征。值得注意的是,生成伪分割目标不会产生额外的可训练参数:它们是在 VLP 过程中通过一个无参数处理器即时获取的。G2D 在 6 项医学成像任务和 25 种疾病上取得了卓越的性能,特别是在需要细粒度、语义上有根据的图像特征的语义分割任务中。在该任务中,即使仅使用 1% 的训练数据进行微调,G2D 也超越了使用 100% 训练数据的同类模型。代码可在 https://github.com/cheliu-computation/G2D-NeurIPS24/tree/main 找到。
引用
@article{arxiv.2312.01522,
title = {G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training},
author = {Che Liu and Cheng Ouyang and Sibo Cheng and Anand Shah and Wenjia Bai and Rossella Arcucci},
journal= {arXiv preprint arXiv:2312.01522},
year = {2024}
}
备注
Accepted by NeurIPS2024