中文

OccludeNet:基于因果推断的混合视角遮挡动作识别

计算机视觉与模式识别 2025-06-10 v2

摘要

常见动作识别视频数据集中缺乏遮挡数据,限制了模型的鲁棒性并阻碍了一致的性能提升。我们构建了OccludeNet,一个大型被遮挡视频数据集,包含不同自然场景中的真实和合成遮挡场景。OccludeNet包括动态遮挡、静态遮挡和多视角交互遮挡,填补了当前数据集的空白。我们的分析表明,遮挡对不同动作类别的影响各不相同:对场景相关性低且部分身体可见性差的动作类别准确率下降幅度更大。为克服现有遮挡感知方法的局限性,我们提出了一种用于遮挡场景的结构因果模型,引入因果动作识别(CAR)方法,该方法使用后门调整和反事实推理。该方法加强了关键演员信息,提高了模型对遮挡的鲁棒性。我们希望OccludeNet的挑战能够鼓励更多研究者关注遮挡场景中的因果关系,并 leads to a fresh look at class relations,最终导致持久的性能提升。我们的代码和数据可在 https://github.com/The-Martyr/OccludeNet-Dataset 获得。

关键词

引用

@article{arxiv.2411.15729,
  title  = {OccludeNet: A Causal Journey into Mixed-View Actor-Centric Video Action Recognition under Occlusions},
  author = {Guanyu Zhou and Wenxuan Liu and Wenxin Huang and Xuemei Jia and Xian Zhong and Chia-Wen Lin},
  journal= {arXiv preprint arXiv:2411.15729},
  year   = {2025}
}