中文

难以分类动作的可解释动作识别

计算机视觉与模式识别 2024-09-23 v1 人工智能

摘要

我们研究一种类人的可解释视频理解模型。人类通过识别明确识别出的物体及其部位之间关键的空间-时间关系(例如,物体进入容器的开口)来识别视频中的复杂活动。为了模拟这一点,我们基于一个使用物体和手的位置及其运动来识别正在发生的活动的模型。为了改进该模型,我们聚焦于(对该模型而言)最易混淆的三个类别,并发现缺乏3D信息是主要问题。为了解决这个问题,我们通过两种方式添加3D感知来扩展基础模型:(1) 对最先进的物体检测模型进行微调,以区分“容器”和“非容器”,从而将物体形状信息整合到现有的物体特征中。(2) 使用最先进的深度估计模型提取单个物体的深度值并计算深度关系,以扩展我们的可解释模型所使用的现有关系。基础模型的这些3D扩展在 Something-Something-v2 数据集中三个表面上相似的“放置”动作子集上进行了评估。结果表明,容器检测器并未提升性能,但深度关系的加入显著提升了性能。

关键词

引用

@article{arxiv.2409.13091,
  title  = {Interpretable Action Recognition on Hard to Classify Actions},
  author = {Anastasia Anichenko and Frank Guerin and Andrew Gilbert},
  journal= {arXiv preprint arXiv:2409.13091},
  year   = {2024}
}

备注

5 pages, This manuscript has been accepted at the Human-inspired Computer Vision (HCV) ECCV 2024 Workshop. arXiv admin note: text overlap with arXiv:2107.05319