CRAM:基于引导压缩的大规模视频持续学习
计算机视觉与模式识别
2025-08-11 v1 机器学习
性能
摘要
持续学习 (CL) 有望使神经网络能够从连续的输入流中学习, 而不是来自 IID (独立且同分布) 采样, 这需要对完整数据集进行随机访问。 这将实现更小的存储需求和部署系统的自给自足, 类似于生物学习。我们专注于视频 CL, 采用基于排练的方法, 通过记忆缓冲区中的过去样本来强化学习。我们认为, 实际视频 CL 具有挑战性的部分原因在于视频的高内存要求, 进一步因长视频和持续流而加剧, 这与常见的排练缓冲区大小限制相矛盾。为此, 我们提出使用压缩视觉技术, 即存储视频代码 (嵌入) 而非原始输入, 并通过从该滚动缓冲区中进行 IID 采样来训练视频分类器。训练视频压缩器在线 (即不依赖于任何预训练网络) 也会遭受灾难性遗忘。我们提出一种解决此遗忘的方法,通过刷新视频代码, 这需要使用先前版本的网络进行解压缩并用新版本进行重新压缩。我们将其命名为持续刷新无关记忆 (CRAM)。我们将当前的视频 CL 基准扩展到大规模设置, 即 EpicKitchens-100 和 Kinetics-700, 在 2 GB 以下存储数千段较长视频, 并通过实验表明, 我们的视频 CL 方法在显著降低内存占用的情况下超越了先前的技术。
引用
@article{arxiv.2508.05001,
title = {CRAM: Large-scale Video Continual Learning with Bootstrapped Compression},
author = {Shivani Mall and Joao F. Henriques},
journal= {arXiv preprint arXiv:2508.05001},
year = {2025}
}