中文

面向少样本学习的基础多模态模型

机器学习 2025-08-08 v1

摘要

少样本学习(FSL)是一种机器学习范式,旨在从少量标记样本(通常每类少于 10 个)中进行模型推广。在生物医学、环境、材料和机械科学中,样本稀缺且数据收集往往昂贵、耗时或伦理受限,FSL 尤为关键。本研究通过表明在跨越多样领域、任务类型和输入模态的独立任务上进行训练的大型多模态模型(LMMM),可显著提升 FSL 模型的推广能力,在相同类型任务上 outperform 基于常规元学习的模型。为支持这一目标,我们首先构建了多模态模型少样本数据集(M3FD,超过 10,000 个少样本样本),包括 2D RGB 图像、2D/3D 医学扫描、表格数据和时间序列数据,其中包含手动挑选的分类等少样本任务。我们进一步引入了 M3F(Multi-Modal Model for Few-shot learning framework),这是一套专为数据受限科学应用设计的新型大型多模态模型框架。M3F 通过模块化管道支持广泛的科学数据类型。在 M3FD 上进行微调后,M3F 提升了模型性能,使大型多模态模型在实际少样本学习部署中具有可行性。源代码位于 https://github.com/ptdang1001/M3F。为降低对复杂 FSL 数据的访问门槛并促进公开用途的可重复性,M3FD 配备了一个灵活易用的工具,支持高效查询、任务特定抽样和预处理。数据集和框架共同提供了一个统一、可扩展的解决方案,显著降低了在数据稀缺科学领域应用大型多模态模型的门槛。

关键词

引用

@article{arxiv.2508.04746,
  title  = {A Foundational Multi-Modal Model for Few-Shot Learning},
  author = {Pengtao Dang and Tingbo Guo and Sha Cao and Chi Zhang},
  journal= {arXiv preprint arXiv:2508.04746},
  year   = {2025}
}

备注

11 pages, 5 figures