中文

大语言模型用于少样本学习中的类别实体推理

计算机视觉与模式识别 2024-08-23 v1

摘要

少样本学习(FSL)旨在使用有限数量的视觉样本识别新概念。现有方法试图将语义信息纳入有限的视觉数据以实现类别理解。然而,这些方法常仅通过抽象类别名称丰富类别级特征表示,无法捕捉有效泛化所必需的细粒度特征。为此,我们提出一种新型FSL框架,融合来自大语言模型(LLM)提取的抽象类别语义与具体类别实体,以增强类别原型的表示。具体而言,框架包含语义引导的视觉模式提取(SVPE)模块和原型校准(PC)模块,其中SVPE在多尺度上细致提取语义感知视觉模式,而PC模块 seamless地将这些模式整合以细化视觉原型,提升其代表性。在四个少样本分类基准测试和BSCD-FSL跨域基准上进行的广泛实验显示,我们的方法显著优于当前最先进的方法。值得注意的是,在具有挑战性的单样本设置下,采用ResNet-12作为 backbone 的方法,相较于第二名最佳竞争者实现了约1.95%的平均提升。

关键词

引用

@article{arxiv.2408.12469,
  title  = {Envisioning Class Entity Reasoning by Large Language Models for Few-shot Learning},
  author = {Mushui Liu and Fangtai Wu and Bozheng Li and Ziqian Lu and Yunlong Yu and Xi Li},
  journal= {arXiv preprint arXiv:2408.12469},
  year   = {2024}
}

备注

9 pages, 7 figures