中文

惊鸿一瞥:重新审视视频持续学习中的时序信息

计算机视觉与模式识别 2023-06-29 v2 人工智能 机器学习

摘要

类增量学习是持续学习研究中最重要的设定之一,因为它与现实世界的应用场景高度相似。在受限的内存大小下,随着类别/任务数量的增加,会出现灾难性遗忘。在视频领域研究持续学习带来了更多挑战,因为视频数据包含大量帧,这对回放内存造成了更高的负担。当前常见的做法是从视频流中下采样帧并存储于回放内存中。本文提出 SMILE,一种基于单帧/独立帧的高效视频持续学习新型回放机制。通过大量实验,我们表明在极端内存约束下,视频多样性比时序信息起到更重要的作用。因此,我们的方法专注于从代表大量独特视频的少数帧中学习。在 Kinetics、UCF101 和 ActivityNet 三个代表性视频数据集上,所提方法达到了最先进的性能,比先前最优方法高出最多 21.49%。

关键词

引用

@article{arxiv.2305.18418,
  title  = {Just a Glimpse: Rethinking Temporal Information for Video Continual Learning},
  author = {Lama Alssum and Juan Leon Alcazar and Merey Ramazanova and Chen Zhao and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2305.18418},
  year   = {2023}
}

备注

Accepted at CLVision Workshop - CVPR23 (Best Paper Award)