利用动作的层次结构与文本语境提升动作识别
计算机视觉与模式识别
2025-11-04 v2 人工智能
摘要
我们提出了一种新方法,通过利用动作的层次组织结构,并融合包含位置信息和前置动作的上下文化文本信息,以反映动作的时序语境,从而提高动作识别性能。为实现此目标,我们引入了专为动作识别设计的转换器架构,同时运用视觉特征与文本特征。视觉特征来自 RGB 与光流数据,而文本嵌入表示上下文信息。此外,我们定义了联合损失函数,同时训练模型以实现粗粒度与细粒度动作识别,有效利用动作的层次结构。为证明方法有效性,我们将 Toyota Smarthome Untrimmed (TSU) 数据集扩展,加入动作层次结构,构建名为 Hierarchical TSU 的层次数据集,旨在监控老年人在家庭环境中的日常活动。消融实验评估了集成上下文与层次数据的不同策略。实验结果表明,所提方法在 Hierarchical TSU 数据集、Assembly101 和 IkeaASM 上均优于当前最先进方法,顶级准确率提升超过 17%。
引用
@article{arxiv.2410.21275,
title = {Enhancing Action Recognition by Leveraging the Hierarchical Structure of Actions and Textual Context},
author = {Manuel Benavent-Lledo and David Mulero-Pérez and David Ortiz-Perez and Jose Garcia-Rodriguez and Antonis Argyros},
journal= {arXiv preprint arXiv:2410.21275},
year = {2025}
}