中文

从真实场景视频中进行表示学习:一种以对象为中心的方法

计算机视觉与模式识别 2021-02-10 v2

摘要

我们提出一种从未筛选视频中学习图像表示的方法。我们结合了来自现成对象检测器的监督损失,以及由每个视频中存在的视频-镜头-帧-对象层次结构自然产生的自监督损失。我们在视觉任务适配基准(VTAB)的19个迁移学习任务和8个分布外泛化任务上报告了有竞争力的结果,并讨论了所提方法的优点与不足。特别地,它在全部18/19少样本学习任务和8/8分布外泛化任务上优于基线。最后,我们进行了若干消融研究并分析了预训练对象检测器在这套任务上性能的影响。

关键词

引用

@article{arxiv.2010.02808,
  title  = {Representation learning from videos in-the-wild: An object-centric approach},
  author = {Rob Romijnders and Aravindh Mahendran and Michael Tschannen and Josip Djolonga and Marvin Ritter and Neil Houlsby and Mario Lucic},
  journal= {arXiv preprint arXiv:2010.02808},
  year   = {2021}
}

备注

Published at WACV 2021