利用关键语义知识强调的报告精炼增强视觉-语言基础模型
计算机视觉与模式识别
2024-09-05 v2
摘要
近年来,视觉-语言表示学习在构建医学基础模型方面取得了显著进展,为改变临床研究和医疗保健的格局带来了巨大潜力。其基本假设是,放射学报告中蕴含的丰富知识可以有效辅助和指导学习过程,从而减少对额外标签的需求。然而,这些报告往往很复杂,有时甚至包含冗余描述,使得表示学习过于困难而难以捕获关键语义信息。本文通过提出一种关键语义知识强调的报告精炼方法,开发了一种新颖的迭代视觉-语言表示学习框架。具体而言,根据构建的临床词典和两个模型优化的知识增强指标,对原始放射学报告进行精炼以突出关键信息。该迭代框架旨在渐进式学习,从基于原始报告对患者病情获得总体理解开始,逐渐精炼并提取对细粒度分析任务至关重要的关键信息。所提出框架的有效性在各种下游医学图像分析任务上得到了验证,包括疾病分类、感兴趣区域分割和短语定位。我们的框架在微调和零样本设置下均超越了七种 SOTA 方法,展示了其在不同临床应用中令人鼓舞的潜力。
引用
@article{arxiv.2401.11421,
title = {Enhancing the vision-language foundation model with key semantic knowledge-emphasized report refinement},
author = {Weijian Huang and Cheng Li and Hao Yang and Jiarun Liu and Yong Liang and Hairong Zheng and Shanshan Wang},
journal= {arXiv preprint arXiv:2401.11421},
year = {2024}
}