中文

面向少数样本学习适配器的训练-only 异构图像-补丁-文本图超级监督

计算机视觉与模式识别 2026-03-20 v1 人工智能 机器学习

摘要

最近的基于适配器的 CLIP 调谐方法(如 Tip-Adapter)是一种强大的少数样本学习器,通过缓存支持特征实现快速原型匹配,从而获得效率优势。然而,这些方法依赖于全局单模态特征向量,忽略了细粒度的 patch 关系及其与类文本的结构对齐。为弥合这一差距且不增加推理成本,我们引入一种新型的非对称训练-only 框架。该框架不改变轻量级适配器,而是在训练期间构建高容量的辅助异构图教师。该教师 (1) 将多尺度视觉 patch 与文本提示整合到统一图中,(2) 通过感知-aware 图变换器(MGT)进行深层跨模态推理,(3) 对节点进行判别性过滤以提取高保真度类特征。关键在于,我们采用 cache-aware 双目标策略,将这种关系知识直接监督到 Tip-Adapter 的 key-value 缓存中,从而在图教师测试时被丢弃,有效提升原型。因此,推理过程与 Tip-Adapter 完全相同,无需额外延迟或内存开销。在标准的 1-16-shot 基准测试中,我们的方法持续地建立了新的最佳性能。消融实验确认,辅助图监督、文本引导的推理和节点过滤是稳健的少数样本适应的关键要素。代码已公开于 https://github.com/MR-Sherif/TOGA.git。

关键词

引用

@article{arxiv.2603.18101,
  title  = {Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters},
  author = {Mohammed Rahman Sherif Khan Mohammad and Ardhendu Behera and Sandip Pradhan and Swagat Kumar and Amr Ahmed},
  journal= {arXiv preprint arXiv:2603.18101},
  year   = {2026}
}

备注

Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026