中文

医疗场景中高效多模态LLMs的压缩策略

人工智能 2025-09-25 v3

摘要

多模态大型语言模型(MLLMs)在医疗领域具有巨大的潜力,但其计算成本需要高效的压缩技术。本文评估了结构剪枝和激活感知量化对针对医疗应用微调的LLAVA模型影响。我们提出了一种新颖的层选择方法用于剪枝,分析了不同量化技术,并评估了prune-SFT-quantize管道中的性能权衡。我们的方法使带有7B参数的MLLMs能够在4GB显存内运行,显存使用降低70%,同时在相同压缩比下实现4%的模型性能提升。

关键词

引用

@article{arxiv.2507.21976,
  title  = {Compression Strategies for Efficient Multimodal LLMs in Medical Contexts},
  author = {Tanvir A. Khan and Aranya Saha and Ismam N. Swapnil and Mohammad A. Haque},
  journal= {arXiv preprint arXiv:2507.21976},
  year   = {2025}
}

备注

16 pages, 7 figures