中文

大语言-视觉模型在无源视频域适应中出乎有效的表现

计算机视觉与模式识别 2023-08-23 v2

摘要

无源视频无监督域适应(SFVUDA)任务旨在将基于有标签源数据集训练的动作识别模型,在不访问实际源数据的情况下,适应到无标签目标数据集。先前的方法试图通过利用从目标数据本身衍生的自监督(例如,强制时间一致性)来解决 SFVUDA。在本工作中,我们采取一种正交思路,利用来自大语言-视觉模型(LLVMs)的“网络监督”,其动机在于 LLVMs 包含丰富且对域偏移具有惊人鲁棒性的世界先验。我们通过设计一种直观且参数高效的方法,展示了将 LLVMs 用于 SFVUDA 的出乎有效的表现,该方法被命名为基于大语言-视觉模型的域适应(DALL-V),其将世界先验与互补的源模型信息蒸馏到一个为目标定制的学生网络中。尽管方法简单,DALL-V 相较最先进的 SFVUDA 方法取得了显著提升。

关键词

引用

@article{arxiv.2308.09139,
  title  = {The Unreasonable Effectiveness of Large Language-Vision Models for Source-free Video Domain Adaptation},
  author = {Giacomo Zara and Alessandro Conti and Subhankar Roy and Stéphane Lathuilière and Paolo Rota and Elisa Ricci},
  journal= {arXiv preprint arXiv:2308.09139},
  year   = {2023}
}

备注

Accepted at ICCV2023, 14 pages, 7 figures, code is available at https://github.com/giaczara/dallv