Temporal DINO:一种增强动作预测的自监督视频策略
计算机视觉与模式识别
2023-08-22 v2 人工智能
摘要
新兴的动作预测领域在自动驾驶、活动分析和人机交互等多种计算机视觉应用中起着至关重要的作用。尽管取得了显著进展,但由于视频数据固有的高维度、复杂动态和不确定性,准确预测未来动作仍是一个具有挑战性的问题。传统的监督方法需要大量标注数据,获取成本高且耗时。本文受 DINO(无标签自蒸馏)启发,提出一种用于增强动作预测的新型自监督视频策略。Temporal-DINO 方法采用两个模型:处理过去帧的“学生”模型和处理过去及未来帧的“教师”模型,从而实现更广阔的时间上下文。在训练期间,教师仅通过观察过去帧来引导学生学习未来上下文。该策略在 ROAD 数据集上使用 3D-ResNet、Transformer 和 LSTM 架构对动作预测下游任务进行评估。实验结果显示这些架构的预测性能均有显著提升,我们的方法平均提升 9.9% 精度点(PP),凸显了其在增强骨干网络捕捉长期依赖能力方面的有效性。此外,我们的方法在预训练数据集规模和所需训练轮数方面表现出高效性。该方法克服了其他方法的局限,包括考虑多种骨干架构、处理多个预测时域、减少对人工数据增强的依赖,以及将预训练过程简化为单阶段。这些发现凸显了我们的方法在基于视频的多样任务(如活动识别、运动规划和场景理解)中的潜力。
引用
@article{arxiv.2308.04589,
title = {Temporal DINO: A Self-supervised Video Strategy to Enhance Action Prediction},
author = {Izzeddin Teeti and Rongali Sai Bhargav and Vivek Singh and Andrew Bradley and Biplab Banerjee and Fabio Cuzzolin},
journal= {arXiv preprint arXiv:2308.04589},
year = {2023}
}