面向细粒度视频动作识别的有效动作区域跟踪框架
计算机视觉与模式识别
2025-11-27 v1
摘要
细粒度动作识别 (FGAR) 旨在识别细粒度动作类别之间的细微且独特的差异。然而,当前的识别方法往往捕获粗粒度的运动模式,却难以识别局部区域随时间演化的细微细节。在本工作中,我们引入了动作区域跟踪 (ART) 框架,一种新型解决方案,利用查询-响应机制发现并跟踪 distinctive 局部细节的动态,从而有效区分相似的动作。具体而言,我们提出了一种区域特定语义激活模块,该模块运用判别性和文本约束的语义作为查询,以捕获每个视频帧中最具动作相关性的区域响应,促进空间维度和时间维度特征之间的相互作用。捕获的区域响应被组织成动作 tracklet,这些 tracklet 通过将相关响应在视频帧之间以连贯序列方式连接起来,来刻画基于区域的动作动态。文本约束的查询编码来自从动作标签的文本描述中提取的语义表示,这些表示由视觉语言模型 (VLM) 中的语言分支提取。为优化动作 tracklet,我们设计了一种多级 tracklet 对比约束,分别在空间和时间层面对区域响应进行对比,以实现每个帧内的有效区分和相邻帧之间的相关性。此外,一个任务特定的微调机制细化了文本语义,使得由 VLM 编码的语义表示在保持原有语义的同时针对任务偏好进行优化。广泛的在常用动作识别基准数据集上的完整实验表明,我们的方法优于以前的 SOTA baseline。
引用
@article{arxiv.2511.21202,
title = {Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition},
author = {Baoli Sun and Yihan Wang and Xinzhu Ma and Zhihui Wang and Kun Lu and Zhiyong Wang},
journal= {arXiv preprint arXiv:2511.21202},
year = {2025}
}