中文

MOFO:面向视频理解的运运动聚焦自监督方法

计算机视觉与模式识别 2023-11-02 v2

摘要

自监督学习(SSL)技术近期在从无标注视频中学习视觉表示方面取得了出色结果。尽管运动在动作识别的监督学习技术中十分重要,SSL 方法往往未显式考虑视频中的运动信息。为解决此问题,我们提出 MOFO(MOtion FOcused),一种新颖的 SSL 方法,用于将表示学习聚焦于视频的运动区域,以用于动作识别。MOFO 自动检测视频中的运动区域,并利用其引导自监督任务。我们使用掩码自编码器,随机掩码输入序列的很高比例;我们强制指定运动区域内部一定百分比被掩码,其余来自外部。我们进一步将运动信息融入微调步骤,以在下游任务中强调运动。我们证明,我们的运动聚焦创新能显著提升当前领先 SSL 方法(VideoMAE)用于动作识别的性能。我们的方法将近期自监督视觉 Transformer(ViT)——VideoMAE,在 Epic-Kitchens 动词、名词与动作分类上分别提升 +2.6%、+2.1%、+1.3% 准确率,并在 Something-Something V2 动作分类上提升 +4.7% 准确率。我们提出的方法显著改进了当前用于动作识别的 SSL 方法,表明在 SSL 中显式编码运动的重要性。

关键词

引用

@article{arxiv.2308.12447,
  title  = {MOFO: MOtion FOcused Self-Supervision for Video Understanding},
  author = {Mona Ahmadian and Frank Guerin and Andrew Gilbert},
  journal= {arXiv preprint arXiv:2308.12447},
  year   = {2023}
}

备注

Accepted at the NeurIPS 2023 Workshop: Self-Supervised Learning - Theory and Practice