关于广义零样本学习中视觉特征的可迁移性
计算机视觉与模式识别
2022-11-23 v1 机器学习
摘要
广义零样本学习(GZSL)旨在训练一个分类器,利用一组属性作为辅助信息以及从预训练卷积神经网络提取的视觉特征,泛化到未见类。尽管近期 GZSL 方法探索了多种技术以利用这些特征的能力,但表征学习技术的广泛发展仍未被充分探索。本工作中,我们研究了不同 GZSL 方法在使用不同特征提取器时的效用,并考察这些模型的预训练目标、数据集和架构设计如何影响其特征表征能力。我们的结果表明:1)使用生成组件的 GZSL 方法在采用近期特征提取器时提供更多优势;2)使用自监督学习目标与知识蒸馏预训练的特征提取器提供更优特征表征,与近期 GZSL 技术结合时性能提升高达 15%;3)用更大数据集预训练的特定特征提取器未必提升 GZSL 方法性能。此外,我们考察了 GZSL 方法相对于 CLIP(一种具备强零样本性能的较新多模态预训练模型)的表现。我们发现 GZSL 任务仍受益于基于生成的 GZSL 方法与 CLIP 的互联网规模预训练相结合,从而在细粒度数据集上达到最先进性能。我们在此发布了一个用于分析 GZSL 中表征学习问题的模块化框架:https://github.com/uvavision/TV-GZSL
引用
@article{arxiv.2211.12494,
title = {On the Transferability of Visual Features in Generalized Zero-Shot Learning},
author = {Paola Cascante-Bonilla and Leonid Karlinsky and James Seale Smith and Yanjun Qi and Vicente Ordonez},
journal= {arXiv preprint arXiv:2211.12494},
year = {2022}
}