用于胸部 X 射线图像检索的多任务跨模态学习
计算机视觉与模式识别
2026-01-12 v1 人工智能
信息检索
摘要
CLIP 和 BiomedCLIP 是视觉-语言基础模型的代表,可提供强大的跨模态嵌入;然而,它们并未针对细粒度的医学检索任务进行优化,例如使用胸部 X 射线 (CXR) 图像查询来检索临床相关的放射学报告。为解决这一不足,我们提出了一个多任务学习框架来微调 BiomedCLIP,并评估其对 CXR 图文检索的改进效果。以 BiomedCLIP 为主干网络,我们引入了一个轻量级的 MLP 投影头,并使用多任务复合损失函数进行训练,该函数包括:(1) 用于区分正常与异常 CXR 研究的二元交叉熵损失,(2) 用于增强类内一致性的监督对比损失,以及 (3) 用于维持跨模态对齐的 CLIP 损失。实验结果表明,与预训练的 BiomedCLIP 和通用 CLIP 模型相比,微调后的模型在图像到文本和文本到图像检索任务中均取得了更均衡且更具临床意义的性能。此外,t-SNE 可视化显示了正常与异常病例更清晰的语义聚类,证明了该模型增强的诊断敏感性。这些发现突出了领域自适应多任务学习在推进生物医学应用跨模态检索方面的价值。
引用
@article{arxiv.2601.05399,
title = {Multi-task Cross-modal Learning for Chest X-ray Image Retrieval},
author = {Zhaohui Liang and Sivaramakrishnan Rajaraman and Niccolo Marini and Zhiyun Xue and Sameer Antani},
journal= {arXiv preprint arXiv:2601.05399},
year = {2026}
}