Troika:面向组合零样本学习的多路径跨模态牵引方法
计算机视觉与模式识别
2024-03-27 v2 计算与语言
机器学习
摘要
近期的组合零样本学习(CZSL)方法通过仅为已见的状态-物体组合构建可训练提示来适配预训练的视觉-语言模型(VLM)。这些方法依赖于学习已见组合的共同表示,忽略了状态和物体的显式建模,从而限制了对预训练知识的利用以及对未见组合的泛化。出于对解决方案通用性的特别关注,本文提出一种新颖的 CZSL 模型范式,其建立三个识别分支(即多路径)来联合建模状态、物体与组合。所提出的 Troika 是我们的实现,其将分支特定的提示表示与分解的视觉特征对齐。为校准语义相似的多模态表示之间的偏差,我们进一步将跨模态牵引模块设计进 Troika,该模块将提示表示向当前视觉内容偏移。我们在三个流行基准上进行了大量实验,所提方法在封闭世界与开放世界设定下均显著优于现有方法。代码将发布于 https://github.com/bighuang624/Troika。
引用
@article{arxiv.2303.15230,
title = {Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning},
author = {Siteng Huang and Biao Gong and Yutong Feng and Min Zhang and Yiliang Lv and Donglin Wang},
journal= {arXiv preprint arXiv:2303.15230},
year = {2024}
}
备注
CVPR 2024