CMAE-V:用于视频动作识别的对比掩码自编码器
计算机视觉与模式识别
2023-01-18 v1
摘要
对比掩码自编码器 (CMAE) 作为一种新的自监督框架,已在视觉图像识别中展现出学习具有表达力的特征表示的潜力。这项工作表明,在不修改架构和损失准则的情况下,CMAE 也能轻松地很好地泛化到视频动作识别上。通过将原始的像素偏移直接替换为时间偏移,我们用于视觉动作识别的 CMAE(简称 CMAE-V)能够生成比基于纯掩码自编码器的对应模型更强的特征表示。值得注意的是,具有混合架构的 CMAE-V 在 Kinetics-400 和 Something-something V2 数据集上分别实现了 82.2% 和 71.6% 的 top-1 准确率。我们希望本报告能为未来的工作提供一些有益的启发。
引用
@article{arxiv.2301.06018,
title = {CMAE-V: Contrastive Masked Autoencoders for Video Action Recognition},
author = {Cheng-Ze Lu and Xiaojie Jin and Zhicheng Huang and Qibin Hou and Ming-Ming Cheng and Jiashi Feng},
journal= {arXiv preprint arXiv:2301.06018},
year = {2023}
}
备注
Technical Report