中文

QwenCLIP:通过 LLM 嵌入和提示调优提升医学视觉语言预训练

计算机视觉与模式识别 2025-11-19 v1

摘要

对比式语言-图像预训练(CLIP)在计算机视觉和医学领域已显示出强大的任务泛化能力,但其文本编码器仅接受最多77个标记,这限制了其表示长且信息丰富的放射科报告的能力。最近的改进方法,如 PubMedBERT 或 ClinicalBERT 等基于领域特定编码器,虽然利用了医学语料库,但仍受限于其有限的输入长度(通常为512个标记)和相对浅的语义理解。在本研究中,我们提出QwenCLIP,一种视觉-语言框架,用大型语言模型(LLM)嵌入模块(例如 Qwen3-Embedding)替换 CLIP 的文本编码器,并引入可学习的提示以增强跨模态对齐。通过利用 LLM 的扩展上下文窗口和更丰富的表示,QwenCLIP 从长格式临床文本中捕获全面的医学语义,大幅提高了医学图像-文本对齐和放射学基准测试中的下游性能。我们的代码已公开available at https://github.com/Wxy-24/QwenCLIP。

关键词

引用

@article{arxiv.2511.13876,
  title  = {QwenCLIP: Boosting Medical Vision-Language Pretraining via LLM Embeddings and Prompt tuning},
  author = {Xiaoyang Wei and Camille Kurtz and Florence Cloppet},
  journal= {arXiv preprint arXiv:2511.13876},
  year   = {2025}
}

备注

This work has been submitted to the IEEE ISBI for possible publication