ESSENTIAL:基于时空语义记忆集成的视频类增量学习
计算机视觉与模式识别
2025-08-15 v1
摘要
本工作针对视频类增量学习(VCIL)问题展开研究。许多现有的 VCIL 方法通过存储少量时序稠密样本的再现训练来缓解灾难性遗忘,这种方法在记忆效率方面较差。另一些方法则存储时序稀疏的样本,牺牲了关键时序信息,导致性能不佳。为解决记忆效率与性能之间的矛盾,我们提出了 EpiSodic and SEmaNTIc memory integrAtion for video class-incremental Learning(时空语义记忆集成视频类增量学习),缩写为 ESSENTIAL。ESSENTIAL 包含用于存储时序稀疏特征的情景记忆,以及用于存储由可学习提示表示的通用知识的语义记忆。我们引入了一种新颖的记忆检索(MR)模块,通过跨注意力机制集成情景记忆和语义提示,实现从稀疏特征中检索时序稠密特征。我们在多样化的数据集上严格验证了 ESSENTIAL:来自 TCD 基准的 UCF-101、HMDB51 和 Something-Something-V2;来自 vCLIMB 基准的 UCF-101、ActivityNet 和 Kinetics-400。令人惊讶的是,在显著降低记忆开销的同时,ESSENTIAL 在基准测试中取得了优异的性能。
引用
@article{arxiv.2508.10896,
title = {ESSENTIAL: Episodic and Semantic Memory Integration for Video Class-Incremental Learning},
author = {Jongseo Lee and Kyungho Bae and Kyle Min and Gyeong-Moon Park and Jinwoo Choi},
journal= {arXiv preprint arXiv:2508.10896},
year = {2025}
}
备注
2025 ICCV Highlight paper, 17 pages including supplementary material