掩码特征建模:用于自底向上视频事件识别的图注意力网络模块无监督预训练中的特征掩码方法
计算机视觉与模式识别
2023-08-28 v2 机器学习
多媒体
摘要
在本文中,我们提出掩码特征建模(MFM),一种用于图注意力网络(GAT)模块无监督预训练的新方法。MFM利用预训练的视觉分词器(Visual Tokenizer)在MiniKinetics数据集上重建视频中物体的掩码特征。随后,我们将预训练的GAT模块集成到最先进的自底向上有监督视频事件识别架构ViGAT中,以改善模型的初始状态和整体准确率。在YLI-MED数据集上的实验评估证明了MFM在提升事件识别性能方面的有效性。
引用
@article{arxiv.2308.12673,
title = {Masked Feature Modelling: Feature Masking for the Unsupervised Pre-training of a Graph Attention Network Block for Bottom-up Video Event Recognition},
author = {Dimitrios Daskalakis and Nikolaos Gkalelis and Vasileios Mezaris},
journal= {arXiv preprint arXiv:2308.12673},
year = {2023}
}
备注
8 pages