增大文本上下文尺寸提升医学图像-文本匹配
机器学习
2023-03-24 v1 计算机视觉与模式识别
摘要
本简短技术报告展示了一种在医学图像-文本匹配任务中取得最先进结果的简单技术。我们分析了OpenAI的CLIP(一种通用图像-文本匹配模型)的使用,并观察到CLIP有限的文本输入尺寸在医学领域对下游性能有负面影响,因为该领域常需要对更长文本上下文进行编码。因此我们训练并发布了ClipMD,其采用简单的滑动窗口技术对文本描述进行编码。ClipMD在两个医学图像-文本数据集上进行了测试,并与其他图像-文本匹配模型比较。结果表明ClipMD在两个数据集上均以大幅优势优于其他模型。我们公开了代码和预训练模型。
引用
@article{arxiv.2303.13340,
title = {Increasing Textual Context Size Boosts Medical Image-Text Matching},
author = {Idan Glassberg and Tom Hope},
journal= {arXiv preprint arXiv:2303.13340},
year = {2023}
}