IMITATE:临床先验引导的分层视觉-语言预训练
计算机视觉与模式识别
2024-10-31 v5 机器学习
摘要
在医学视觉-语言预训练 (VLP) 领域,已有大量工作致力于从临床报告及相应医学图像中提取文本与图像特征。然而,多数现有方法可能忽视了利用临床报告固有分层结构的机会,此类报告通常分为描述性内容的“所见”与结论性观察的“印象”。当前的医学 VLP 方法常将报告简化为统一实体或碎片化词元,而非利用这一丰富的结构化格式。本工作中,我们提出一种名为 IMITATE 的新型临床先验引导 VLP 框架,通过分层视觉-语言对齐从医学报告中学习结构信息。该框架从胸部 X 光 (CXR) 图像中提取多级视觉特征,并分别将这些特征与分层医学报告中编码的描述性文本和结论性文本对齐。此外,引入了一种新的临床知情对比损失用于跨模态学习,其在构建对比学习中的样本关联时考虑了临床先验知识。所提模型 IMITATE 在六个不同数据集、五项医学影像下游任务上优于基线 VLP 方法。综合实验结果凸显了整合医学报告分层结构用于视觉-语言对齐的优势。本文相关代码见 https://github.com/cheliu-computation/IMITATE-TMI2024。
引用
@article{arxiv.2310.07355,
title = {IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training},
author = {Che Liu and Sibo Cheng and Miaojing Shi and Anand Shah and Wenjia Bai and Rossella Arcucci},
journal= {arXiv preprint arXiv:2310.07355},
year = {2024}
}
备注
Accepted by TMI2024