面向零样本动作识别的全局语义描述子
计算机视觉与模式识别
2022-09-27 v1
摘要
零样本动作识别(ZSAR)方法的成功与用于迁移知识的语义侧信息的性质内在相关,尽管文献中并未主要研究这一方面。本文提出了一种基于动作-物体与动作-描述性句子关系的新型 ZSAR 方法。我们证明,当使用释义估计方法作为嵌入器时,用描述性句子表示所有物体类别能够生成准确的物体-动作亲和度估计。我们还展示了如何仅基于一组句子而无硬性人工标注来估计动作类别集合上的概率。在我们的方法中,来自这两个全局分类器(即使用在整个视频上计算的特征的分类器)的概率被组合,产生了一种用于动作分类的高效迁移知识模型。我们的结果在 Kinetics-400 数据集上达到 SOTA,并在 ZSAR 评测下的 UCF-101 上具有竞争力。我们的代码可在 https://github.com/valterlej/objsentzsar 获取。
引用
@article{arxiv.2209.12061,
title = {Global Semantic Descriptors for Zero-Shot Action Recognition},
author = {Valter Estevam and Rayson Laroca and Helio Pedrini and David Menotti},
journal= {arXiv preprint arXiv:2209.12061},
year = {2022}
}