论视频动作检测中的遮挡:基准数据集与训练方案
摘要
本文探讨了遮挡在视频动作检测中的影响。我们通过引入五个新的基准数据集来促进这项研究:包含受控合成的静态/动态遮挡的 O-UCF 和 O-JHMDB,包含具有真实运动遮挡的 OVIS-UCF 和 OVIS-JHMDB,以及用于真实场景下遮挡的 Real-OUCF。我们正式确认了一个直观预期:随着遮挡严重程度的增加,现有模型性能大幅下降,并且在静态遮挡物与动态遮挡物下表现出不同的行为。我们发现了神经网络中出现的几个有趣现象:1) Transformer 可以自然地胜过那些甚至在训练期间将遮挡用作数据增强形式的 CNN 模型;2) 将胶囊等符号组件引入此类骨干网络,使其能够绑定在训练期间从未见过的遮挡物;3) 在没有实例级监督、蒸馏或基于对比的目标(例如视频-文本训练)的情况下,一致岛屿可以在真实图像/视频中涌现。这些涌现特性使我们能够推导出简单而有效的训练方案,从而归纳性地得到满足绑定机制前两个阶段(分组/隔离)的鲁棒遮挡模型。利用这些方案的模型在遮挡条件下的 vAP 指标上优于现有的视频动作检测器,在 O-UCF 上提升 32.3%,在 O-JHMDB 上提升 32.7%,在 Real-OUCF 上提升 2.6%。本工作的代码已发布于 https://github.com/rajatmodi62/OccludedActionBenchmark。
关键词
引用
@article{arxiv.2410.19553,
title = {On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes},
author = {Rajat Modi and Vibhav Vineet and Yogesh Singh Rawat},
journal= {arXiv preprint arXiv:2410.19553},
year = {2024}
}
备注
This paper was accepted to NeurIPS 2023 Dataset And Benchmark Track. It also showcases: Hinton's Islands of Agreement on realistic datasets which were previously hypothesized in his GLOM paper