中文

LLM 不是全部:基于文本和图像的医学分类中 ML 与基础模型的系统评估

人工智能 2026-01-26 v1

摘要

多模态视觉语言模型 (VLMs) 与大语言模型 (LLMs) 的结合为医学分类开辟了新可能。本工作提供了严格、统一的基准测试,利用覆盖文本和图像模态(二分类和多分类复杂度)的四个公开数据集,对比传统机器学习 (ML) 与当代基于变换器技术的方法。我们评估了每个任务中的三个模型类别:经典 ML (LR、LightGBM、ResNet-50)、基于提示的 LLM/VLM (Gemini 2.5) 和微调 PEFT 模型(LoRA 适配的 Gemma3 变体)。所有实验均使用一致的数据划分和对齐指标。根据我们的发现,传统机器学习模型在大多数医学分类任务中始终实现最佳整体性能,尤其在结构化文本数据集上表现尤为出色。与此相反,LoRA 微调的 Gemma 变体在所有文本和图像实验中表现最差,未能从最小的微调中获得良好泛化。然而,零样本 LLM/VLM 流水线(Gemini 2.5)结果呈混合态;它们在文本任务上表现不佳,但在多分类图像任务中展现出竞争性能,与经典 ResNet-50 基准相当。这些结果表明,在许多医学分类场景中,已建立的机器学习模型仍是最可靠的选择。实验表明,基础模型并非 universally superior,参数高效微调 (PEFT) 的效果高度依赖于适应策略,本研究中最小的微调方法导致性能下降。

关键词

引用

@article{arxiv.2601.16549,
  title  = {LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification},
  author = {Meet Raval and Tejul Pandit and Dhvani Upadhyay},
  journal= {arXiv preprint arXiv:2601.16549},
  year   = {2026}
}

备注

9 pages, 5 figures, 3 tables, paper accepted in AAIML'26 conference