从文本推断潜在类别统计以实现鲁棒视觉少样本学习
计算机视觉与模式识别
2023-11-27 v1 人工智能
摘要
在少样本学习领域,诸如 CLIP 之类的基础模型已被证明有效,但在跨域鲁棒性方面存在局限,尤其在少样本设定下。近期工作添加文本作为额外模态以增强这些模型的性能。此类方法大多将文本视为辅助模态,而未充分挖掘其阐明底层类别视觉特征分布的潜力。本文提出一种新方法,利用文本导出的统计量来预测每个类别的视觉特征分布的均值与协方差。该预测框架丰富了潜在空间,从而产生更鲁棒且可泛化的少样本学习模型。我们证明了在多个数据集上纳入均值与协方差统计量对提升少样本分类性能的有效性。我们的方法表明,我们可以使用文本预测分布的均值与协方差,从而在少样本学习场景中带来有前景的改进。
引用
@article{arxiv.2311.14544,
title = {Inferring Latent Class Statistics from Text for Robust Visual Few-Shot Learning},
author = {Yassir Bendou and Vincent Gripon and Bastien Pasdeloup and Giulia Lioi and Lukas Mauch and Fabien Cardinaux and Ghouthi Boukli Hacene},
journal= {arXiv preprint arXiv:2311.14544},
year = {2023}
}
备注
R0-FoMo: Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023