JOADAA:联合在线动作检测与动作预测
计算机视觉与模式识别
2023-09-13 v1 人工智能
摘要
动作预测涉及通过将过去事件与未来事件相连来预报未来动作。然而,这种推理忽略了现实生活中的事件层级,该层级被认为由三个主要部分构成:过去、现在和未来。我们认为,考虑这三个主要部分及其依赖关系可提升性能。另一方面,在线动作检测是以流式方式预测动作的任务。在此情况下,只能获取过去和现在的信息。因此,在在线动作检测(OAD)中,现有方法缺失语义或未来信息,限制了其性能。总之,对于这两项任务,完整知识体系(过去-现在-未来)均缺失,这使得推断动作依赖关系具有挑战性,从而导致性能低下。为解决此局限,我们提出将两项任务融合为单一统一架构。通过结合动作预测与在线动作检测,我们的方法可弥补在线动作检测中未来信息的缺失依赖。该方法称为 JOADAA,提出了一种联合执行动作预测与在线动作检测的统一模型。我们在三个具有挑战性的数据集上验证所提模型:THUMOS'14(每时间步一个动作的稀疏标注数据集)、CHARADES 和 Multi-THUMOS(两个具有更复杂场景的密集标注数据集)。JOADAA 在这些基准上针对两项任务均取得了 SOTA 结果。
引用
@article{arxiv.2309.06130,
title = {JOADAA: joint online action detection and action anticipation},
author = {Mohammed Guermal and Francois Bremond and Rui Dai and Abid Ali},
journal= {arXiv preprint arXiv:2309.06130},
year = {2023}
}