从静态到动态:探索自监督图像到视频表示迁移学习
计算机视觉与模式识别
2026-03-30 v1
摘要
近期研究通过将图像预训练模型迁移至视频任务,在视频表示学习方面取得了显著进展,通常需要复杂的时间模块和视频微调。然而,微调重型模块可能损害视频间的语义可分离性,即区分不同视频中物体的基本能力。同时,减少可微调参数会削弱视频内的时序一致性,这是同一物体在视频内稳定表示所必需的。这一困境表明,在图像到视频迁移过程中,视频内时序一致性与视频间语义可分离性之间可能存在权衡。为此,我们提出了自一致性-可分离性权衡迁移学习框架(Consistency-Separability Trade-off Transfer Learning, Co-Settle),该框架在冻结的图像预训练编码器顶部施加一个轻量投影层,通过时间循环一致性目标和语义可分离性约束来调整表示空间。我们进一步提供了理论支持,证明在适当条件下,优化后的投影能在两种特性之间取得更好的权衡。在八个图像预训练模型上的实验表明,仅需五个epoch的自监督训练,即可在视频任务的多个层面上一致性地提升性能。代码可在 https://github.com/yafeng19/Co-Settle 获取。
引用
@article{arxiv.2603.26597,
title = {From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learning},
author = {Yang Liu and Qianqian Xu and Peisong Wen and Siran Dai and Xilin Zhao and Qingming Huang},
journal= {arXiv preprint arXiv:2603.26597},
year = {2026}
}
备注
Accepted at CVPR 2026