利用时间压缩池化学习时空表示
计算机视觉与模式识别
2022-01-14 v2
摘要
本文提出一种新的视频表示学习方法,称为时间压缩(TS)池化,它可从长序列视频帧中提取关键运动信息并映射为少量图像,称为压缩图像。通过将时间压缩池化作为一层嵌入现成的卷积神经网络(CNN)中,我们设计了一种新的视频分类模型,称为时间压缩网络(TeSNet)。所得压缩图像包含来自视频帧的关键运动信息,对应于视频分类任务的优化。我们在两个视频分类基准上评估我们的架构,并将所得结果与最先进水平进行比较。
引用
@article{arxiv.2002.04685,
title = {Learning spatio-temporal representations with temporal squeeze pooling},
author = {Guoxi Huang and Adrian G. Bors},
journal= {arXiv preprint arXiv:2002.04685},
year = {2022}
}