中文

增大文本上下文尺寸提升医学图像-文本匹配

机器学习 2023-03-24 v1 计算机视觉与模式识别

摘要

本简短技术报告展示了一种在医学图像-文本匹配任务中取得最先进结果的简单技术。我们分析了OpenAI的CLIP(一种通用图像-文本匹配模型)的使用,并观察到CLIP有限的文本输入尺寸在医学领域对下游性能有负面影响,因为该领域常需要对更长文本上下文进行编码。因此我们训练并发布了ClipMD,其采用简单的滑动窗口技术对文本描述进行编码。ClipMD在两个医学图像-文本数据集上进行了测试,并与其他图像-文本匹配模型比较。结果表明ClipMD在两个数据集上均以大幅优势优于其他模型。我们公开了代码和预训练模型。

关键词

引用

@article{arxiv.2303.13340,
  title  = {Increasing Textual Context Size Boosts Medical Image-Text Matching},
  author = {Idan Glassberg and Tom Hope},
  journal= {arXiv preprint arXiv:2303.13340},
  year   = {2023}
}