中文

CLASTER:基于强化学习的聚类零样本动作识别

计算机视觉与模式识别 2022-07-26 v3

摘要

零样本动作识别是在无视觉样例、仅借助将未见类与已见类关联起来的语义嵌入的情况下识别动作类的任务。该问题可视为学习一个对未见类实例泛化良好且类间不丢失判别性的函数。神经网络可建模视觉类间的复杂边界,这解释了其作为监督模型的成功。然而,在零样本学习中,这些高度专门化的类边界可能难以从已见类迁移至未见类。本文提出一种基于质心的表示,其对视觉与语义表示进行聚类,一次性考虑所有训练样本,从而对已见类实例良好泛化。我们利用强化学习优化该聚类,并证明其对方法奏效至关重要。我们将所提方法称为CLASTER,并观察到它在所有标准数据集(包括UCF101、HMDB51与Olympic Sports)上持续优于SOTA,无论是在标准零样本评估还是广义零样本学习中。此外,我们表明我们的模型在图像领域同样具有竞争力,在许多设定下优于SOTA。

关键词

引用

@article{arxiv.2101.07042,
  title  = {CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action Recognition},
  author = {Shreyank N Gowda and Laura Sevilla-Lara and Frank Keller and Marcus Rohrbach},
  journal= {arXiv preprint arXiv:2101.07042},
  year   = {2022}
}

备注

Accepted to ECCV-22