解耦视觉嵌入中的属性与物体特征
计算机视觉与模式识别
2022-05-18 v1 机器学习
摘要
我们研究面向物体-属性识别的组合式零样本学习问题。先前工作使用以物体分类为目标预训练的骨干网络提取视觉特征,因而无法捕捉与属性相关的细微独特特征。为克服这一挑战,这些研究借助语言空间的监督,并使用预训练词嵌入来更好地分离和组合属性-物体对以进行识别。类似于语言嵌入空间中已存在对物体和属性唯一且无关的嵌入,我们将焦点转回视觉空间,并提出一种能够在视觉空间中解耦属性与物体特征的新型架构。我们利用视觉分解特征来生成对已见和未见组合具有代表性的嵌入,以更好地正则化模型学习。大量实验表明,我们的方法在三个数据集上以显著优势超越现有工作:MIT-States、UT-Zappos 以及基于 VAW 创建的新基准。代码、模型和数据集划分已公开于 https://github.com/nirat1606/OADis。
引用
@article{arxiv.2205.08536,
title = {Disentangling Visual Embeddings for Attributes and Objects},
author = {Nirat Saini and Khoi Pham and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2205.08536},
year = {2022}
}
备注
To appear at CVPR 2022 (Oral)