中文

跨模态少样本学习:一种生成式迁移学习框架

计算机视觉与模式识别 2025-03-12 v2 机器学习

摘要

大多数现有研究聚焦于单模态少样本学习场景,即通过单一模态中有限数量的标记样本来泛化至未见数据。然而,真实世界数据本质上具有多模态特性,这些单模态方法限制了少样本学习的实际应用。为填补这一差距,本文引入了跨模态少样本学习 (CFSL) 任务,旨在依赖稀缺标记数据来识别跨多个模态的实例。这一任务与经典少样本学习不同,源于每个模态中固有的视觉属性和结构差异。为应对这些挑战,我们提出了生成式迁移学习 (GTL) 框架,通过模拟人类抽象和概括概念的方式来实现。具体而言,GTL 通过生成结构联合估计跨模态的共享概念以及模态内扰动。通过建立共享概念与视觉内容之间的关系,这种方法利用丰富的单模态数据,能够有效地将知识从单模态迁移到新型的多模态数据,就像人类一样。全面实验表明,GTL 在 RGB-Sketch、RGB-Infrared 和 RGB-Depth 跨七个多模态数据集上实现了当前最先进的性能。

关键词

引用

@article{arxiv.2410.10663,
  title  = {Cross-Modal Few-Shot Learning: a Generative Transfer Learning Framework},
  author = {Zhengwei Yang and Yuke Li and Qiang Sun and Basura Fernando and Heng Huang and Zheng Wang},
  journal= {arXiv preprint arXiv:2410.10663},
  year   = {2025}
}

备注

15 pages, 9 figures, 7 tables