增量动作分割的相干时间合成
计算机视觉与模式识别
2024-03-12 v1
摘要
数据回放是一种成功的图像增量学习技术。它通过保留先前数据的存储库(原始数据或合成数据)来防止灾难性遗忘,确保模型在适应新概念的同时保留过去的知识。然而,其在视频领域的应用尚处于初级阶段,仅存储用于动作识别的帧示例。本文首次探索了用于增量动作分割的视频数据回放技术,重点关注动作时间建模。我们提出了时间相干动作 (TCA) 模型,该模型使用生成模型来表示动作,而不是存储单个帧。通过整合捕捉时间相干性的条件变量,我们的模型能够理解动作特征随时间的演变。因此,由 TCA 生成用于回放的动作文段具有多样性且在时间上相干。在 Breakfast 数据集上的 10 任务增量设置中,与基线相比,我们的方法将准确率显著提高了高达 22%。
引用
@article{arxiv.2403.06102,
title = {Coherent Temporal Synthesis for Incremental Action Segmentation},
author = {Guodong Ding and Hans Golong and Angela Yao},
journal= {arXiv preprint arXiv:2403.06102},
year = {2024}
}
备注
10 pages, 6 figures, 5 tables, accepted to CVPR 2024