医疗场景中高效多模态LLMs的压缩策略
人工智能
2025-09-25 v3
摘要
多模态大型语言模型(MLLMs)在医疗领域具有巨大的潜力,但其计算成本需要高效的压缩技术。本文评估了结构剪枝和激活感知量化对针对医疗应用微调的LLAVA模型影响。我们提出了一种新颖的层选择方法用于剪枝,分析了不同量化技术,并评估了prune-SFT-quantize管道中的性能权衡。我们的方法使带有7B参数的MLLMs能够在4GB显存内运行,显存使用降低70%,同时在相同压缩比下实现4%的模型性能提升。
引用
@article{arxiv.2507.21976,
title = {Compression Strategies for Efficient Multimodal LLMs in Medical Contexts},
author = {Tanvir A. Khan and Aranya Saha and Ismam N. Swapnil and Mohammad A. Haque},
journal= {arXiv preprint arXiv:2507.21976},
year = {2025}
}
备注
16 pages, 7 figures