中文

探索LLM编码器在胸部X射线图像-文本检索中的能力

计算机视觉与模式识别 2025-09-22 v1

摘要

视觉-语言预训练已推进图像-文本对齐,但放射学领域的进展受到临床报告异质性的制约,包括缩写、仅印象笔记和风格差异。与通用领域设置中更多数据通常带来更好性能不同,盲目扩展到大量嘈杂报告集合可能会使模型学习达到瓶颈甚至退化。我们探讨大型语言模型(LLM)编码器是否能提供鲁棒的临床表示,在不同风格间有效迁移并更好地指导图像-文本对齐。我们提出了LLM2VEC4CXR,一个针对胸部X射线报告的领域自适应LLM编码器,以及LLM2CLIP4CXR,一个将该编码器与视觉骨干网络耦合的双塔框架。LLM2VEC4CXR在临床文本理解方面优于基于BERT的基线,能够处理缩写和风格变化,并在报告级指标上实现了较强的临床对齐。LLM2CLIP4CXR利用这些嵌入来提升检索准确率和临床导向评分,在跨数据集泛化方面优于先前的医学CLIP变体。我们的模型在160万项来自公共和私有来源的CXR研究上训练,这些研究具有异质性和嘈杂的报告,证明了鲁棒性——而非规模本身——是有效多模态学习的关键。我们发布模型以支持医学图像-文本表示学习领域的进一步研究。

关键词

引用

@article{arxiv.2509.15234,
  title  = {Exploring the Capabilities of LLM Encoders for Image-Text Retrieval in Chest X-rays},
  author = {Hanbin Ko and Gihun Cho and Inhyeok Baek and Donguk Kim and Joonbeom Koo and Changi Kim and Dongheon Lee and Chang Min Park},
  journal= {arXiv preprint arXiv:2509.15234},
  year   = {2025}
}

备注

24 pages, 2 figures, under review