利用在无标签公开视频上训练的基础模型推进人体动作识别
计算机视觉与模式识别
2024-07-17 v4
摘要
各种在线平台上日益多样化和海量的带标签多媒体内容为推进人体动作识别领域提供了独特的机会。在本研究中,我们利用 283,582 个独特的、无标签的 TikTok 视频片段,分类为 386 个标签,来训练一个用于动作识别的特定领域基础模型。我们采用 VideoMAE V2,这是一个将掩码自编码器(MAE)与视觉Transformer(ViT)相结合的先进模型,并在这多样化的非结构化视频集合上进行了预训练。我们的模型在 UCF101 和 HMDB51 等既定动作识别基准上进行了微调,取得了最先进的结果:使用 ViT-giant 骨干网络,在 UCF101 上达到 99.05%,在 HMDB51 上达到 86.08%,在 Kinetics-400 上达到 85.51%,在 Something-Something V2 上达到 74.27%。这些结果凸显了利用非结构化和无标签视频作为训练基础模型的多样化动态内容来源的潜力。我们的研究证实,虽然预训练数据量的初始增加能显著提升模型性能,但随着数据集规模的持续扩大,收益会递减。我们的发现强调了计算机视觉自监督学习中的两个关键原则:(1)额外的预训练数据可能对某些数据集产生递减的收益;(2)在自监督学习中,尤其是在构建基础模型时,质量比数量更重要。
引用
@article{arxiv.2402.08875,
title = {Advancing Human Action Recognition with Foundation Models trained on Unlabeled Public Videos},
author = {Yang Qian and Yinan Sun and Ali Kargarandehkordi and Parnian Azizian and Onur Cezmi Mutlu and Saimourya Surabhi and Pingyi Chen and Zain Jabbar and Dennis Paul Wall and Peter Washington},
journal= {arXiv preprint arXiv:2402.08875},
year = {2024}
}
备注
10 pages