中文

REST:用于生成式动作识别的检索与自训练方法

计算机视觉与模式识别 2022-09-30 v1 人工智能 机器学习

摘要

本工作致力于训练一个生成式动作/视频识别模型,其输出为描述视频的自由的、动作特定的字幕(而非动作类别标签)。生成式方法具有实际优势,例如产生更细粒度且人类可读的输出,并天然地具备开放世界特性。为此,我们提出将预训练的生成式视觉与语言(V&L)基础模型适配于视频/动作识别。尽管近期已有若干尝试将基于对比学习训练的V&L模型(如CLIP)适配于视频/动作,但据我们所知,我们提出了首个旨在为生成式模型实现此目标的方法。我们首先表明,直接微调生成式模型以产生动作类别会遭受严重的过拟合。为缓解该问题,我们引入REST,一个包含两关键组件的训练框架:一种无监督方法,通过伪字幕生成和自训练(即不使用任何动作特定标签)将生成式模型适配于动作/视频;(b)一种基于CLIP的检索方法,用于为每个视频发现多样化的伪字幕集合以训练模型。重要的是,我们表明两个组件对于获得高精度都是必要的。我们在零样本动作识别问题上评估REST,结果表明与基于对比学习的方法相比,我们的方法极具竞争力。代码将公开。

关键词

引用

@article{arxiv.2209.15000,
  title  = {REST: REtrieve & Self-Train for generative action recognition},
  author = {Adrian Bulat and Enrique Sanchez and Brais Martinez and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:2209.15000},
  year   = {2022}
}