当未来成为过去:驯服自监督视频表示学习中的时序对应性
计算机视觉与模式识别
2025-03-20 v1
摘要
过去十年来,随着自监督学习在视频任务方面取得显著进展。最近的研究通常采用掩码视频建模(MVM)范式,在多个视频任务上取得显著进展。然而仍存在两个关键挑战:1)缺乏人工标注,随机时序采样引入不确定性,增加模型训练难度;2)以往 MVM 方法主要在像素空间恢复被掩码块,导致下游任务的信息压缩不足。为同时解决这两个挑战,我们提出一种自监督框架,利用时序对应性进行视频表示学习(T-CoRe)。针对挑战 1),我们提出夹层采样策略,以两种辅助帧选取方式减少重建不确定性;针对挑战 2),我们引入辅助分支于自蒸馈架构中,以在潜在空间恢复表示,生成包含时序信息的高层语义表示。T-CoRe 的实验在多个下游任务上 consistently 表现出优异性能,证明其在视频表示学习中的有效性。代码已公开于 https://github.com/yafeng19/T-CORE。
引用
@article{arxiv.2503.15096,
title = {When the Future Becomes the Past: Taming Temporal Correspondence for Self-supervised Video Representation Learning},
author = {Yang Liu and Qianqian Xu and Peisong Wen and Siran Dai and Qingming Huang},
journal= {arXiv preprint arXiv:2503.15096},
year = {2025}
}
备注
Accepted at CVPR 2025