中文

LLM 的微调方法能否应用于医学多模态领域?

计算机视觉与模式识别 2024-07-09 v2

摘要

尽管大型语言模型(LLM)在世界知识理解方面表现出色,但要将其适应于特定子领域仍需进行精确调整。由于模型规模庞大,针对大型模型的传统全局微调方法计算成本高昂且会影响泛化能力。为应对这一挑战,一系列创新的参数高效微调(PEFT)方法应运而生,并在 LLM 和大型视觉语言模型(LVLM)中取得了显著成功。在医学领域,微调医学视觉语言预训练(VLP)模型对于将其适应于特定任务至关重要。大型模型的微调方法能否迁移至医学领域以提升迁移学习效率?在本文中,我们深入研究了 LLM 的微调方法,并进行了大量实验,从训练数据层面和模型结构层面探讨了大型模型微调方法对现有医学领域多模态模型的影响。我们展示了大型模型微调方法对医学 VLM 的不同影响,并开发了最高效的医学 VLP 模型微调方式。我们希望这项研究能指导医学领域研究人员优化 VLM 的训练成本,促进 VLM 在医疗领域的更广泛应用。代码和数据集已发布于 https://github.com/TIMMY-CHAN/MILE。

关键词

引用

@article{arxiv.2403.06407,
  title  = {Can LLMs' Tuning Methods Work in Medical Multimodal Domain?},
  author = {Jiawei Chen and Yue Jiang and Dingkang Yang and Mingcheng Li and Jinjie Wei and Ziyun Qian and Lihua Zhang},
  journal= {arXiv preprint arXiv:2403.06407},
  year   = {2024}
}

备注

Accepted by MICCAI 2024