CLIP中的语言增强用于改进多模态医学图像上的解剖结构检测
计算机视觉与模式识别
2024-06-03 v1
摘要
视觉-语言模型已成为医学领域中先前具有挑战性的多模态分类问题的强大工具。这一发展导致了对多模态临床扫描自动图像描述生成的探索,特别是用于放射学报告生成。现有研究集中于特定模态或身体区域的临床描述,缺乏提供全身多模态描述的模型。在本文中,我们通过自动化生成多模态MR和CT放射学图像中全身的标准化身体站和器官列表来填补这一空白。利用对比语言-图像预训练(CLIP)的多功能性,我们通过多个实验改进和增强了现有方法,包括基线模型微调、添加身体站作为器官之间更好关联的超集,以及图像和语言增强。我们提出的方法在基线PubMedCLIP上实现了47.6%的性能提升。
引用
@article{arxiv.2405.20735,
title = {Language Augmentation in CLIP for Improved Anatomy Detection on Multi-modal Medical Images},
author = {Mansi Kakkar and Dattesh Shanbhag and Chandan Aladahalli and Gurunath Reddy M},
journal= {arXiv preprint arXiv:2405.20735},
year = {2024}
}
备注
$\copyright$ 2024 IEEE. Accepted in 46th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC) 2024