中文

通过难样本块挖掘的自举掩码视觉建模

计算机视觉与模式识别 2023-12-22 v1

摘要

掩码视觉建模因其在学习可泛化表示方面的巨大潜力而备受关注。典型方法促使模型预测掩码 token 的特定内容,这可以直观地理解为教导学生(模型)解决给定问题(预测掩码内容)。在此类设置下,性能与掩码策略(所提供问题的难度)高度相关。我们认为,让模型站在教师的立场上自行生成具有挑战性的问题同样重要。直观上,重建损失值较高的块可视为难样本,而掩码这些难块自然构成了一项苛刻的重建任务。为了赋予模型教师的能力,我们提出了难块挖掘(Hard Patches Mining, HPM),即预测逐块损失并随后确定掩码位置。技术上,我们引入了一个辅助损失预测器,并通过相对目标进行训练以防止过拟合于确切的损失值。此外,为了逐步引导训练过程,我们提出了一种由易到难的掩码策略。实证表明,HPM 在图像和视频基准测试中均带来了显著改进。有趣的是,仅引入额外的损失预测目标就能获得更好的表示,验证了确定何处难以重建的有效性。代码地址:https://github.com/Haochen-Wang409/HPM。

关键词

引用

@article{arxiv.2312.13714,
  title  = {Bootstrap Masked Visual Modeling via Hard Patches Mining},
  author = {Haochen Wang and Junsong Fan and Yuxi Wang and Kaiyou Song and Tiancai Wang and Xiangyu Zhang and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2312.13714},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2304.05919