中文

聚焦效率: LayerNorm 作为医学视觉语言预训练模型微调的催化剂

计算机视觉与模式识别 2024-04-26 v1

摘要

在医学视觉语言模型 (Med-VLMs) 中,寻找通用的高效微调机制至关重要,尤其是因为来自跨学科领域的研究人员往往极度短缺训练资源,而且这一问题鲜有探讨。鉴于医学领域的独特挑战,如数据范围受限和显著的领域特定要求,评估和针对 Med-VLMs 进行参数效率微调 (PEFT) 方法至关重要。目前大多数针对 Med-VLMs 的 PEFT 方法尚未进行全面调查,主要侧重于向模型结构或输入添加某些组件。然而,微调模型的内在组件往往能获得更好的普适性和一致性,而其对最终 Med-VLMs 性能的影响被广泛忽视且仍未受到深入研究。本文旨在探讨传统 PEFT 方法的另一种选择,尤其是微调 LayerNorm 层、FFN 和注意力层对 Med-VLMs 的影响。我们的全面研究涵盖小规模和大规模 Med-VLMs,在诸如医学视觉问答和医学影像报告生成等任务上评估其在各种微调范式下的性能。结果揭示了关于微调 Med-VLMs 内在参数的方法对下游任务影响的独特见解,并暴露了仅微调 LayerNorm 层不仅超过传统 PEFT 方法的效率,还在广泛的医学下游任务中保持了模型的准确性和泛化能力。实验表明,LayerNorm 微调在大规模 Med-VLMs 语境下的适应性和可扩展性尤为突出。

关键词

引用

@article{arxiv.2404.16385,
  title  = {Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models},
  author = {Jiawei Chen and Dingkang Yang and Yue Jiang and Mingcheng Li and Jinjie Wei and Xiaolu Hou and Lihua Zhang},
  journal= {arXiv preprint arXiv:2404.16385},
  year   = {2024}
}