中文

PCBEAR:用于可解释动作识别的姿态概念瓶颈

计算机视觉与模式识别 2025-04-18 v1

摘要

人类动作识别(HAR)已获得深度学习模型的显著成果,但其决策过程因其黑箱本质而保持不可见。对于需要透明度和问责制的实际应用,确保可解释性至关重要。现有的视频可解释AI方法主要依赖特征归因或静态文本概念,两者都难以捕获动作理解所必需的运动动态和时序依赖性。为此,我们提出一种用于可解释动作识别的姿态概念瓶颈(PCBEAR),这是一种新型概念瓶颈框架,引入人类姿态序列作为运动感知、结构化概念用于视频动作识别。不同于基于像素级特征或静态文本描述的方法,PCBEAR利用人类骨架姿态,仅聚焦于身体运动,提供对运动动态的稳健且可解释的解释。我们定义两种基于姿态的概念:用于单个帧中空间配置的静态姿态概念,以及用于跨多个帧的运动模式的动态姿态概念。为构建这些概念,PCBEAR对视频姿态序列应用聚类,允许在无需手动标注的情况下自动发现有意义的概念。我们在KTH、Penn-Action和HAA500上对PCBEAR进行了验证,结果表明它在实现高分类性能的同时,提供了可解释的、由运动驱动的解释。该方法提供了强大的预测性能和人类可理解的洞察,有助于模型推理过程的理解,使能够在测试时进行干预,以调试和改进模型行为。

关键词

引用

@article{arxiv.2504.13140,
  title  = {PCBEAR: Pose Concept Bottleneck for Explainable Action Recognition},
  author = {Jongseo Lee and Wooil Lee and Gyeong-Moon Park and Seong Tae Kim and Jinwoo Choi},
  journal= {arXiv preprint arXiv:2504.13140},
  year   = {2025}
}

备注

This paper is accepted by CVPRW 2025