VT-FSL:利用 LLM 桥接视觉与文本以实现少样本学习
计算机视觉与模式识别
2025-10-24 v3 机器学习
摘要
少样本学习 (FSL) 旨在仅从少量带标签的支持样本中识别新概念。近期的研究通过引入额外的语义信息或设计复杂的语义融合模块来增强支持特征。然而,由于缺乏对实际实例的依据,它们仍会产生与视觉证据相矛盾的幻觉语义,导致噪声指导和昂贵的修正。为了解决这些问题,我们提出了一个新颖的框架——利用 LLM 桥接视觉与文本以实现少样本学习 (VT-FSL),该框架基于大语言模型 (LLM) 和支持图像构建精确的跨模态提示,并通过几何感知对齐将它们无缝整合。它主要由跨模态迭代提示 (CIP) 和跨模态几何对齐 (CGA) 组成。具体而言,CIP 以类名和支持图像为条件,在单次结构化推理过程中迭代生成精确的类描述。这些描述不仅丰富了对新类的语义理解,还实现了语义一致图像的零样本合成。这些描述和合成图像分别作为互补的文本和视觉提示,提供高级类语义和类内低级多样性,以弥补支持数据的不足。此外,CGA 通过最小化它们张成的三维平行多面体的核化体积,联合对齐融合后的文本、支持和合成视觉表示。它捕获所有表示之间的全局和非线性关系,实现结构化且一致的多模态整合。所提出的 VT-FSL 方法在十个不同的基准上确立了新的 SOTA 性能,涵盖标准、跨域和细粒度少样本学习场景。代码可在 https://github.com/peacelwh/VT-FSL 获取。
引用
@article{arxiv.2509.25033,
title = {VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning},
author = {Wenhao Li and Qiangchang Wang and Xianjing Meng and Zhibin Wu and Yilong Yin},
journal= {arXiv preprint arXiv:2509.25033},
year = {2025}
}
备注
Accepted by NeurIPS 2025