中文

SkeletonAgent:面向骨架基础动作识别的智能体交互框架

计算机视觉与模式识别 2026-03-13 v3

摘要

近期的骨架基础动作识别研究越来越多地利用大语言模型(LLM)从语义先验条件中丰富骨架表示。然而,LLM 通常以孤立方式被查询,且未接收到识别模型的性能反馈,导致其无法提供区分相似动作所必需的针对性判别线索。为克服这些限制,我们提出了 SkeletonAgent,一种新颖的框架,通过两个合作智能体(Questioner 和 Selector)桥接识别模型与 LLM。具体而言,Questioner 识别最常混淆的类别并将其作为上下文供 LLM 以获得更有针对性的指导。相反,Selector 解析 LLM 的响应,从而提取精确的关节级约束并将其反馈给识别模型,实现更细粒度的跨模态对齐。在包括 NTU RGB+D、NTU RGB+D 120、Kinetics-Skeleton、FineGYM 和 UAV-Human 在内的五个基准数据集上进行的全面评估表明,SkeletonAgent 在所有最先进的基准方法上均表现出色。代码已公开于 https://github.com/firework8/SkeletonAgent。

关键词

引用

@article{arxiv.2511.22433,
  title  = {SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition},
  author = {Hongda Liu and Yunfan Liu and Changlu Wang and Yunlong Wang and Zhenan Sun},
  journal= {arXiv preprint arXiv:2511.22433},
  year   = {2026}
}