AutoLabel:基于 CLIP 的开放集视频域自适应框架
计算机视觉与模式识别
2023-04-05 v2
摘要
开放集无监督视频域自适应(OUVDA)致力于将动作识别模型从有标签的源域自适应到包含“目标私有”类别的无标签目标域,这些类别仅存在于目标域而不在源域中。在本工作中,我们偏离先前训练专门的开放集分类器或加权对抗学习的方法,提出使用预训练的语言与视觉模型(CLIP)。CLIP 因其丰富的表示能力和零样本识别能力而非常适用于 OUVDA。然而,利用 CLIP 的零样本协议拒绝目标私有实例需要关于目标私有标签名称的先验知识。为规避标签名称知识不可得的问题,我们提出 AutoLabel,其自动发现并生成以对象为中心的组合式候选目标私有类名。尽管简单,我们表明配备 AutoLabel 的 CLIP 能令人满意地拒绝目标私有实例,从而促进两域共享类之间更好的对齐。代码已公开。
引用
@article{arxiv.2304.01110,
title = {AutoLabel: CLIP-based framework for Open-set Video Domain Adaptation},
author = {Giacomo Zara and Subhankar Roy and Paolo Rota and Elisa Ricci},
journal= {arXiv preprint arXiv:2304.01110},
year = {2023}
}
备注
Accepted to CVPR 2023