用于自监督视频表征学习的掩码运动编码
计算机视觉与模式识别
2023-03-24 v2
摘要
如何从未经标记的视频中学习有判别力的视频表征具有挑战性,但对视频分析至关重要。最近的尝试寻求通过预测掩码区域中的外观内容来学习表征模型。然而,简单地掩码和恢复外观内容可能不足以建模时间线索,因为外观内容可以容易地从单帧中重建。为克服这一限制,我们提出掩码运动编码(MME),一种重建外观和运动信息以探索时间线索的新预训练范式。在MME中,我们着重解决两个关键挑战以提升表征性能:1)如何很好地表示跨多帧的可能的长期运动;以及2)如何从稀疏采样的视频中获得细粒度时间线索。受人类能够通过跟踪物体位置变化和形状变化来识别动作的启发,我们提出在掩码区域中重建表示这两类变化运动轨迹。此外,给定稀疏视频输入,我们强制模型在空间和时域两个维度上重建稠密运动轨迹。使用我们的MME范式预训练,模型能够预测长期和细粒度运动细节。代码可在 https://github.com/XinyuSun/MME 获取。
引用
@article{arxiv.2210.06096,
title = {Masked Motion Encoding for Self-Supervised Video Representation Learning},
author = {Xinyu Sun and Peihao Chen and Liangwei Chen and Changhao Li and Thomas H. Li and Mingkui Tan and Chuang Gan},
journal= {arXiv preprint arXiv:2210.06096},
year = {2023}
}
备注
CVPR 2023 camera-ready version