固定预算参数高效训练结合冻结编码器提升多模态胸部X光分类性能
计算机视觉与模式识别
2025-12-29 v1
摘要
多模态胸部X光分析常需对大型视觉语言模型进行微调,这种做法计算成本高昂。我们研究了包括冻结编码器、BitFit、LoRA和适配器在内的多种参数高效训练(PET)策略,用于对印第安纳大学胸部X光数据集(3,851张图像报告配对;579个测试样本)进行多标签分类。为缓解数据泄露风险,我们从报告中遮盖病理术语作为文本输入,同时保留临床上下文。在固定参数预算(237万参数,总参数的2.51%)下,所有PET变体实现的AUROC范围为0.892至0.908,显著优于全参数微调(0.770 AUROC),后者使用了943万可训练参数,参数量降低了40倍。在更大规模的CheXpert数据集(224,316张图像)上的外部验证确认了可扩展性:所有PET方法在使用不到9%可训练参数的情况下均实现>0.69 AUROC,其中适配器方法取得最佳性能(0.7214 AUROC)。预算匹配的比较揭示,视觉单模态模型(0.653 AUROC,106万参数)优于预算匹配的多模态模型(0.641 AUROC,106万参数),表明性能提升主要来自参数配置而非跨模态协同。虽然PET方法显示出较差的校准表现(ECE:0.29-0.34),但相对简单模型(ECE:0.049),这属于可通过后置校准方法解决的可处理局限。本研究表明,冻结编码器策略在大幅降低计算成本的同时,提供了优越的判别能力,但临床部署仍需校准修正。
引用
@article{arxiv.2512.21508,
title = {Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification},
author = {Md Ashik Khan and Md Nahid Siddique},
journal= {arXiv preprint arXiv:2512.21508},
year = {2025}
}
备注
Accepted at the 2025 28th International Conference on Computer and Information Technology (ICCIT). 6 pages, 6 figures