视觉-语言模型中基于词性的子空间
计算机视觉与模式识别
2023-11-14 v2 机器学习
摘要
视觉-语言模型产生的潜在图像表示已被证明对多种下游任务极为有用。然而,它们因与不同视觉属性的纠缠而受限。例如,最近的工作表明 CLIP 图像表示常以不可预测的方式偏向特定视觉属性(如物体或动作)。在本文中,我们提出通过利用词性与特定视觉变化模式之间的关联(例如名词对应物体、形容词描述外观),在 CLIP 的联合视觉-语言空间中分离不同视觉模态的表示。这是通过构建一个合适的成分分析模型来实现的,该模型学习捕获对应于特定词性的可变性的子空间,同时联合最小化相对于其余部分的可变性。这样的子空间以闭式给出图像或文本不同视觉属性的解纠缠表示,同时尊重表示所在流形的底层几何结构。此外,我们表明所提出的模型还便于学习与特定视觉外观(例如艺术家的绘画风格)对应的子空间,从而能够从基于 CLIP 的文本到图像合成中有选择地移除整个视觉主题。我们通过文本到图像模型可视化子空间投影并防止模仿艺术家风格,以及通过类别不变性度量和基线零样本分类的改进,对模型进行了定性和定量验证。
引用
@article{arxiv.2305.14053,
title = {Parts of Speech-Grounded Subspaces in Vision-Language Models},
author = {James Oldfield and Christos Tzelepis and Yannis Panagakis and Mihalis A. Nicolaou and Ioannis Patras},
journal= {arXiv preprint arXiv:2305.14053},
year = {2023}
}
备注
Accepted at NeurIPS 2023