当前的长时视频理解数据集是否真正长时?
计算机视觉与模式识别
2023-08-23 v1
摘要
许多现实应用,从体育分析到监控,都受益于自动长时动作识别。在当前用于自动动作识别的深度学习范式下,模型必须在评估此类模型是否真正学习并推理长时信息的数据集与任务上训练和测试。本工作中,我们提出一种评估视频数据集对长时动作识别模型评估适用度的方法。为此,我们将长时动作定义为排除所有仅利用短时信息即可正确识别的视频。我们在三个流行真实数据集(即Breakfast、CrossTask与LVU)的现有长时分类任务上测试该定义,以确定这些数据集是否真正评估长时识别。我们的研究揭示这些数据集可利用基于短时信息的捷径被有效解决。循此发现,我们鼓励长时动作识别研究者使用需要长时信息才能解决的数据集。
引用
@article{arxiv.2308.11244,
title = {Are current long-term video understanding datasets long-term?},
author = {Ombretta Strafforello and Klamer Schutte and Jan van Gemert},
journal= {arXiv preprint arXiv:2308.11244},
year = {2023}
}