ELIXR:通过对齐大语言模型与放射学视觉编码器迈向通用 X 射线人工智能系统
计算机视觉与模式识别
2023-09-11 v2 图像与视频处理
摘要
在本工作中,我们提出一种称为 Embeddings for Language/Image-aligned X-Rays(ELIXR)的方法,其利用一个语言对齐的图像编码器结合或嫁接到一个固定的 LLM(PaLM 2)上,以执行广泛的胸部 X 射线任务。我们使用来自 MIMIC-CXR 数据集的、配有相应自由文本放射学报告的图像训练这一轻量适配器架构。ELIXR 在零样本胸部 X 射线(CXR)分类(13 项发现上平均 AUC 为 0.850)、数据高效 CXR 分类(在 1%(约 2,200 张图像)和 10%(约 22,000 张图像)训练数据下,五项发现(肺不张、心脏肥大、实变、胸腔积液和肺水肿)上平均 AUC 分别为 0.893 和 0.898)以及语义检索(19 个查询上归一化折损累计增益(NDCG)为 0.76,其中 12 个实现完美检索)上均达到了最先进性能。与包括监督对比学习(SupCon)在内的现有数据高效方法相比,ELIXR 所需数据量少两个数量级即可达到相似性能。ELIXR 在 CXR 视觉-语言任务上也展现出潜力,在视觉问答和报告质量保证任务上分别取得了 58.7% 和 62.5% 的总体准确率。这些结果表明 ELIXR 是一种鲁棒且通用的 CXR AI 方法。
引用
@article{arxiv.2308.01317,
title = {ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders},
author = {Shawn Xu and Lin Yang and Christopher Kelly and Marcin Sieniek and Timo Kohlberger and Martin Ma and Wei-Hung Weng and Atilla Kiraly and Sahar Kazemzadeh and Zakkai Melamed and Jungyeon Park and Patricia Strachan and Yun Liu and Chuck Lau and Preeti Singh and Christina Chen and Mozziyar Etemadi and Sreenivasa Raju Kalidindi and Yossi Matias and Katherine Chou and Greg S. Corrado and Shravya Shetty and Daniel Tse and Shruthi Prabhakara and Daniel Golden and Rory Pilgrim and Krish Eswaran and Andrew Sellergren},
journal= {arXiv preprint arXiv:2308.01317},
year = {2023}
}