监督对比帧聚合用于视频表征学习
计算机视觉与模式识别
2025-12-16 v1 机器学习
摘要
我们提出一种监督对比学习框架用于视频表征学习,利用时序全局上下文。我们引入一种视频到图像聚合策略,将每个视频的多个帧在空间上排列成单个输入图像。这种设计使我们能够使用预训练的卷积神经网络骨干网络(如 ResNet50),避免复杂视频变换模型的计算开销。我们然后设计一种对比学习目标,直接比较模型生成的成对投影。正样本定义为来自同一标签视频的投影,而所有其他投影被视为负样本。通过相同底层视频的不同时间帧抽样创建多个自然视图。不依赖数据增强,这些帧级变异产生具有全局上下文的多样化正样本并减少过拟合。在Penn Action 和 HMDB51 数据集上的实验表明,所提方法在分类准确率上优于现有方法,同时所需计算资源更少。该方法在监督和自监督设置下均能学习有效的视频表征,并支持视频基础任务,如分类和描述。该方法在Penn Action 上实现76%的分类准确率,而ViVIT 仅达43%;在HMDB51 上达48%,而ViVIT 仅达37%。
关键词
引用
@article{arxiv.2512.12549,
title = {Supervised Contrastive Frame Aggregation for Video Representation Learning},
author = {Shaif Chowdhury and Mushfika Rahman and Greg Hamerly},
journal= {arXiv preprint arXiv:2512.12549},
year = {2025}
}
备注
12 pages