中文

基于非参数深度嵌入聚类的无监督视频持续学习

计算机视觉与模式识别 2025-09-01 v1 人工智能 机器学习

摘要

本文提出了一种更贴近现实的无监督视频学习场景:在学习一系列任务时,既不提供任务边界,也不提供标签。我们提供了一种非参数学习解决方案,以解决该领域中较少探索的无监督视频持续学习问题。视频代表了复杂丰富的时空媒介信息,广泛应用于诸多应用场景,但在无监督持续学习中尚未得到充分探索。以往研究仅聚焦于监督式持续学习,依赖标签和任务边界,而标注数据成本高昂且不够实用。为填补这一空白,我们研究了无监督视频持续学习 (unsupervised video continual learning, uVCL)。uVCL 因处理视频的计算和内存要求增加而提出了更高的挑战。我们通过考虑每个任务中学习非结构化视频数据类别,制定了通用的实验协议。我们提出使用深度嵌入视频特征由无监督视频变换网络提取的核密度估计 (kernel density estimation, KDE),作为数据的非参数概率表示。我们引入了针对新任务数据的新奇检测准则,动态启用内存簇的扩展,以捕获连续学习任务中的新知识。我们利用迁移学习从先前任务中获得的初始状态,用于知识传递到当前学习任务。我们发现,所提出的方法在连续学习多个任务时显著提升了模型性能。我们在三个标准视频动作识别数据集上进行了深入评估,包括 UCF101、HMDB51 和 Something-to-Something V2,且未使用任何标签或类别边界。

关键词

引用

@article{arxiv.2508.21773,
  title  = {Unsupervised Video Continual Learning via Non-Parametric Deep Embedded Clustering},
  author = {Nattapong Kurpukdee and Adrian G. Bors},
  journal= {arXiv preprint arXiv:2508.21773},
  year   = {2025}
}

备注

Accepted to The 36th British Machine Vision Conference (BMVC 2025), Sheffield, UK