面向动作识别的提示引导解耦表示
计算机视觉与模式识别
2025-11-25 v4
摘要
动作识别是视频理解中的一项基础任务。现有方法通常提取统一特征来处理单个视频中的所有动作,这使得在多动作场景下建模不同对象之间的交互变得具有挑战性。为了缓解这一问题,我们探索将复杂场景中的任意指定动作进行解耦作为一种有效的解决方案。在本文中,我们提出了面向动作识别的提示引导解耦表示 (ProDA),这是一种新颖的框架,能够从多动作场景中解耦任意指定动作。ProDA 利用时空场景图 (SSGs) 并引入动态提示模块 (DPM),以指导图解析神经网络 (GPNN) 生成动作特定的表示。此外,我们设计了一种视频自适应的 GPNN,使用动态权重聚合信息。视频动作识别实验证明了我们的方法与 SOTA 方法相比的有效性。我们的代码可在 https://github.com/iamsnaping/ProDA.git 找到
引用
@article{arxiv.2509.21783,
title = {Prompt-guided Disentangled Representation for Action Recognition},
author = {Tianci Wu and Guangming Zhu and Jiang Lu and Siyuan Wang and Ning Wang and Nuoye Xiong and Zhang Liang},
journal= {arXiv preprint arXiv:2509.21783},
year = {2025}
}