中文

时间至关重要:面向视频Transformer的时间自监督

计算机视觉与模式识别 2022-07-20 v1 人工智能 机器学习

摘要

理解视频的时间动态是学习更好视频表示的一个重要方面。近来,由于基于Transformer的架构设计能够捕捉输入序列的长期依赖,其已被广泛探索用于视频任务。然而,我们发现这些视频Transformer仍然偏向于学习空间动态而非时间动态,而去偏这种虚假关联对其性能至关重要。基于这些观察,我们为视频模型设计了简单而有效的自监督任务,以更好地学习时间动态。具体而言,为去偏空间偏置,我们的方法将视频帧的时间顺序作为额外自监督进行学习,并强制随机打乱的帧具有低置信度输出。此外,我们的方法学习连续帧之间视频token的时间流方向,以增强朝向时间动态的相关性。在各种视频动作识别任务下,我们证明了方法的有效性及其与最先进视频Transformer的兼容性。

关键词

引用

@article{arxiv.2207.09067,
  title  = {Time Is MattEr: Temporal Self-supervision for Video Transformers},
  author = {Sukmin Yun and Jaehyung Kim and Dongyoon Han and Hwanjun Song and Jung-Woo Ha and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2207.09067},
  year   = {2022}
}

备注

Accepted to ICML 2022. Code is available at https://github.com/alinlab/temporal-selfsupervision