Proto-CLIP:用于少样本学习的视觉-语言原型网络
计算机视觉与模式识别
2024-07-16 v3 机器人学
摘要
我们提出了一种利用CLIP等大规模视觉-语言模型进行少样本学习的新框架。受用于少样本学习的单模态原型网络启发,我们引入了Proto-CLIP,其利用图像原型与文本原型进行少样本学习。具体而言,Proto-CLIP以联合方式使用少样本样本适配来自CLIP的图像与文本编码器嵌入。来自两个编码器的嵌入被用于计算相应图像类别的原型以进行分类。在适配过程中,我们提出对相应类别的图像与文本原型进行对齐。由于来自两类原型的增强贡献,此种对齐有益于少样本分类。Proto-CLIP具有免训练与微调两种变体。我们通过在少样本学习基准数据集以及真实世界机器人感知上的实验证明了方法的有效性。项目页面位于 https://irvlutd.github.io/Proto-CLIP
引用
@article{arxiv.2307.03073,
title = {Proto-CLIP: Vision-Language Prototypical Network for Few-Shot Learning},
author = {Jishnu Jaykumar P and Kamalesh Palanisamy and Yu-Wei Chao and Xinya Du and Yu Xiang},
journal= {arXiv preprint arXiv:2307.03073},
year = {2024}
}
备注
Accepted at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)