中文

从单一连续视频流中学习

计算机视觉与模式识别 2024-04-01 v2 人工智能

摘要

我们提出一种从单一连续视频流进行在线学习的框架——这是人与动物学习的方式,不使用小批量、数据增强或打乱顺序。鉴于连续视频帧之间的高度相关性,这带来了巨大挑战,且此前极少有相关工作。我们的框架使我们能够首次深入探究该主题,包含由现有两个视频数据集构成的流与任务集合,以及考虑适应性与泛化的性能评估方法。我们采用像素到像素建模作为一种实用且灵活的方式,在预训练与单流评估之间以及任意任务之间切换,而无需更改模型,且始终使用相同的像素损失。借助该框架,我们通过一类新颖的未来预测任务从预训练中获得了巨大的单流学习收益,发现动量有害,且权重更新节奏至关重要。这些洞见的组合在使用相同架构且无需昂贵回放缓冲区的情况下,达到了批大小为 1 的 IID 学习性能。

关键词

引用

@article{arxiv.2312.00598,
  title  = {Learning from One Continuous Video Stream},
  author = {João Carreira and Michael King and Viorica Pătrăucean and Dilara Gokay and Cătălin Ionescu and Yi Yang and Daniel Zoran and Joseph Heyward and Carl Doersch and Yusuf Aytar and Dima Damen and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2312.00598},
  year   = {2024}
}

备注

CVPR camera ready version