利用双图像与视频Transformer改进迁移学习用于多标签电影预告片类型分类
计算机视觉与模式识别
2023-03-30 v4 机器学习
摘要
本文研究了 ImageNet 空间表征与 Kinetics 时空表征向多标签电影预告片类型分类(MTGC)的迁移能力。具体而言,我们针对 Trailers12k(一个由 12,000 个视频组成、标注有 10 种不同类型和相关元数据的全新人工整理电影预告片数据集)上在 ImageNet 和 Kinetics 预训练的 ConvNet 与 Transformer 模型的迁移能力进行了广泛评估。我们分析了可能影响迁移能力的不同因素,如帧率、输入视频扩展名以及时空建模。为缩小 ImageNet/Kinetics 与 Trailers12k 之间的时空结构差距,我们提出了双图像与视频 Transformer 架构(DIViTA),该架构执行镜头检测以将预告片分割为高度相关的片段,为预训练骨干网络提供更连贯的输入并提升迁移能力(ImageNet 提升 1.83%,Kinetics 提升 3.75%)。我们的结果表明,在 ImageNet 或 Kinetics 上学习到的表征对 Trailers12k 均具有相当的迁移能力。此外,两个数据集提供互补信息,可结合以提升分类性能(较最佳单一预训练提升 2.91%)。有趣的是,使用轻量级 ConvNet 作为预训练骨干网络相较最佳 Transformer 仅导致分类性能下降 3.46%,而其参数量仅需后者的 11.82%、FLOPS 仅需 0.81%。
引用
@article{arxiv.2210.07983,
title = {Improving Transfer Learning with a Dual Image and Video Transformer for Multi-label Movie Trailer Genre Classification},
author = {Ricardo Montalvo-Lezama and Berenice Montalvo-Lezama and Gibran Fuentes-Pineda},
journal= {arXiv preprint arXiv:2210.07983},
year = {2023}
}