中文

基于残差的语言模型是生物医学影像的免费助推器

计算机视觉与模式识别 2024-04-01 v3 计算与语言 机器学习

摘要

在本研究中,我们揭示了基于残差的大型语言模型(LLMs)作为编码器的一部分在生物医学影像任务中意想不到的有效性,而该领域传统上缺乏语言或文本数据。该方法不同于既有方法论,它利用从预训练 LLMs 中提取的冻结 Transformer 块,作为直接处理视觉令牌的创新编码器层。这一策略显著偏离了通常依赖于语言驱动提示和输入的标准多模态视觉-语言框架。我们发现这些 LLMs 能够提升一系列生物医学影像应用的性能,包括 2D 和 3D 视觉分类任务,充当即插即用的助推器。更有趣的是,作为附带成果,我们发现所提出的框架取得了卓越的性能,在 MedMNIST-2D 和 3D 的广泛标准化数据集上设立了新的最先进结果。通过这项工作,我们旨在为在生物医学影像中应用 LLMs 开辟新途径,并丰富对其在这一专业领域潜力的理解。

关键词

引用

@article{arxiv.2403.17343,
  title  = {Residual-based Language Models are Free Boosters for Biomedical Imaging},
  author = {Zhixin Lai and Jing Wu and Suiyao Chen and Yucheng Zhou and Naira Hovakimyan},
  journal= {arXiv preprint arXiv:2403.17343},
  year   = {2024}
}