中文

DropMAE:基于空间注意力丢弃掩码自编码器学习表征用于时序匹配任务

计算机视觉与模式识别 2025-04-07 v3

摘要

本文研究用于各类基于时序匹配下游任务的掩码自编码器(MAE)视频预训练,即目标级跟踪任务(包括视频目标跟踪(VOT)和视频目标分割(VOS))、自监督视觉对应学习、稠密跟踪任务(包括光流估计与长时点跟踪)以及3D点云跟踪。具体而言,本工作探索提供一种通用表征以增强各类下游跟踪任务中的时序匹配能力。为此,我们首先发现MAE的简单扩展(随机掩码视频中的帧块并重建帧像素)严重依赖空间线索而忽略时序关系进行帧重建,从而导致次优的时序匹配表征。为缓解此问题,我们提出DropMAE,其在帧重建中自适应地执行空间注意力丢弃,以促进视频中的时序对应学习。我们通过DropMAE得到若干重要发现:1)DropMAE是一个强大且高效的时序匹配学习器,在基于匹配的任务上取得了比基于ImageNet的MAE更好的微调结果,且预训练速度加快2倍。2)DropMAE对不同跟踪任务均有效,即目标级匹配任务(包括VOT和VOS)、稠密跟踪任务(包括光流估计与任意点跟踪(TAP)),甚至点云数据不同模态下的3D跟踪。由于此前不存在此类方法,我们为不同下游跟踪任务构建了基于ViT的跟踪器,且我们预训练的DropMAE模型可直接载入这些基于ViT的跟踪器进行微调而无需进一步修改。在6个下游跟踪任务上的实验证明了DropMAE作为多样跟踪任务通用预训练表征的有效性。

关键词

引用

@article{arxiv.2304.00571,
  title  = {DropMAE: Learning Representations via Masked Autoencoders with Spatial-Attention Dropout for Temporal Matching Tasks},
  author = {Qiangqiang Wu and Tianyu Yang and Ziquan Liu and Wei Lin and Baoyuan Wu and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2304.00571},
  year   = {2025}
}

备注

Extension of DropMAE for 6 temporal matching-based downstream tasks