PoseBridge:为零样本基于骨架的动作识别弥合骨架化鸿沟
计算机视觉与模式识别
2026-05-13 v1
摘要
零样本基于骨架的动作识别(ZSSAR)通常被视为一个骨架-文本对齐问题:编码关节坐标序列,将其与语言对齐,并对未见过的动作进行分类。我们认为,这种对齐往往为时已晚。骨架并非完整的动作观察,而是人体姿态估计(HPE)的压缩输出;在对齐开始时,人-物交互和姿态相关的视觉线索可能已不再明确。我们将此称为上游语义损失。为解决此问题,我们提出了PoseBridge,一个具有HPE感知的ZSSAR框架,它在中间HPE表征与骨架-文本对齐之间架起桥梁。PoseBridge并非添加RGB动作分支或目标检测器,而是从产生骨架的同一HPE过程中提取姿态锚定的语义线索,然后通过骨架条件桥接和语义原型自适应将其迁移。在NTU-RGB+D 60/120、PKU-MMD和Kinetics-200/400数据集上,PoseBridge在评估协议下提升了ZSSAR性能。在包含多样化场景和动作上下文的真实世界视频的Kinetics-200/400 PURLS基准上,PoseBridge表现出最明显的优势,在所有八个划分上,将最强对比基线提升了13.3-17.4个百分点。我们的代码将公开发布。
引用
@article{arxiv.2605.11497,
title = {PoseBridge: Bridging the Skeletonization Gap for Zero-Shot Skeleton-Based Action Recognition},
author = {Sanghyeon Lee and Jinwoo Kim and Jong Taek Lee},
journal= {arXiv preprint arXiv:2605.11497},
year = {2026}
}