中文

利用动作的层次结构与文本语境提升动作识别

计算机视觉与模式识别 2025-11-04 v2 人工智能

摘要

我们提出了一种新方法,通过利用动作的层次组织结构,并融合包含位置信息和前置动作的上下文化文本信息,以反映动作的时序语境,从而提高动作识别性能。为实现此目标,我们引入了专为动作识别设计的转换器架构,同时运用视觉特征与文本特征。视觉特征来自 RGB 与光流数据,而文本嵌入表示上下文信息。此外,我们定义了联合损失函数,同时训练模型以实现粗粒度与细粒度动作识别,有效利用动作的层次结构。为证明方法有效性,我们将 Toyota Smarthome Untrimmed (TSU) 数据集扩展,加入动作层次结构,构建名为 Hierarchical TSU 的层次数据集,旨在监控老年人在家庭环境中的日常活动。消融实验评估了集成上下文与层次数据的不同策略。实验结果表明,所提方法在 Hierarchical TSU 数据集、Assembly101 和 IkeaASM 上均优于当前最先进方法,顶级准确率提升超过 17%。

关键词

引用

@article{arxiv.2410.21275,
  title  = {Enhancing Action Recognition by Leveraging the Hierarchical Structure of Actions and Textual Context},
  author = {Manuel Benavent-Lledo and David Mulero-Pérez and David Ortiz-Perez and Jose Garcia-Rodriguez and Antonis Argyros},
  journal= {arXiv preprint arXiv:2410.21275},
  year   = {2025}
}