基于统计矩与子空间描述子的自监督动作识别
计算机视觉与模式识别
2021-08-06 v2
摘要
本文基于自监督概念,以 RGB 帧为输入,学习预测动作概念及辅助描述子(例如物体描述子)。所谓的幻觉流被训练以预测辅助线索,同时送入分类层,并在测试阶段被幻觉化以辅助网络。我们设计并幻觉化两种描述子:一种利用应用于训练视频的四个流行物体检测器,另一种利用图像级和视频级显著性检测器。第一个描述子编码检测器及 ImageNet 类的预测分数、置信度分数、边界框空间位置与帧索引,以捕获每视频特征的时空分布。另一描述子编码显著性图和强度模式的空角梯度分布。受概率分布特征函数启发,我们在上述中间描述子上捕获四个统计矩。由于均值、协方差、余偏度和余峰度中的系数数分别随特征向量维数线性、二次、三次和四次增长,我们用其前 n' 个特征向量(所谓子空间)描述协方差矩阵,并捕获偏度/峰度而非代价高昂的余偏度/余峰度。我们在 Charades 和 EPIC-Kitchens 等五个流行数据集上取得了当前最优结果。
引用
@article{arxiv.2001.04627,
title = {Self-supervising Action Recognition by Statistical Moment and Subspace Descriptors},
author = {Lei Wang and Piotr Koniusz},
journal= {arXiv preprint arXiv:2001.04627},
year = {2021}
}
备注
ACM MM'21