强化学习遇见掩码视频建模:基于轨迹的自适应标记选择
计算机视觉与模式识别
2025-08-15 v2
摘要
掩码视频建模(MVM)已成为视觉基础模型中高度有效的预训练策略,通过利用可见标记的信息来重建被掩码的时空标记。然而,这类方法面临的关键挑战在于选择合适的掩码策略。以往研究探索了包括随机掩码和管状掩码在内的预定义掩码技术,以及利用外部预训练模型中关键运动先验、光流和语义线索的方法。本文引入一种新颖且可泛化的轨迹感知自适应标记采样器(Trajectory-Aware Adaptive Token Sampler, TATS),该模型对标记的运动动力学进行建模,可无缝集成到掩码自编码器(MAE)框架中,以选择视频中的运动导向标记。此外,我们提出了一种统一的训练策略,使MAE和TATS可从零开始通过近端策略优化(PPO)进行联合优化。我们表明,该模型可在不损害动作识别下下游任务性能的前提下实现激进的掩码,同时保持预训练的内存效率。对该方法在四个基准(包括Something-Something v2、Kinetics-400、UCF101和HMDB51)的广泛实验表明,我们方法在有效性、可迁移性、泛化性和效率方面均优于其他最先进方法。
引用
@article{arxiv.2505.08561,
title = {Reinforcement Learning meets Masked Video Modeling : Trajectory-Guided Adaptive Token Selection},
author = {Ayush K. Rai and Kyle Min and Tarun Krishna and Feiyan Hu and Alan F. Smeaton and Noel E. O'Connor},
journal= {arXiv preprint arXiv:2505.08561},
year = {2025}
}
备注
Accepted in ICCVW 2025 - Long Multi-Scene Video Foundations Workshop