基于序列对比学习的长视频逐帧动作表征
计算机视觉与模式识别
2022-03-29 v1
摘要
先前关于动作表征学习的工作主要集中于设计各种架构来提取短视频片段的全局表征。相比之下,许多实际应用(如视频对齐)对长视频的稠密表征有强烈需求。在本文中,我们引入一种新颖的对比动作表征学习(CARL)框架,以自监督方式学习逐帧动作表征,尤其是针对长视频。具体而言,我们引入一个简单而高效的视频编码器,其考虑时空上下文以提取逐帧表征。受自监督学习近期进展的启发,我们提出一种新颖的序列对比损失(SCL),应用于通过一系列时空数据增强获得的两个相关视图。SCL 通过最小化两个增强视图的序列相似度与时间戳距离先验高斯分布之间的 KL 散度来优化嵌入空间。在 FineGym、PennAction 和 Pouring 数据集上的实验表明,我们的方法在下游细粒度动作分类上大幅优于先前最优方法。令人惊讶的是,尽管未在配对视频上训练,我们的方法在视频对齐和细粒度帧检索任务上也展现出卓越性能。代码和模型可在 https://github.com/minghchen/CARL_code 获取。
引用
@article{arxiv.2203.14957,
title = {Frame-wise Action Representations for Long Videos via Sequence Contrastive Learning},
author = {Minghao Chen and Fangyun Wei and Chong Li and Deng Cai},
journal= {arXiv preprint arXiv:2203.14957},
year = {2022}
}
备注
Accepted by CVPR 2022