中文

SBF:一种有效的骨架增强表示用于基于视频的人类动作识别

计算机视觉与模式识别 2026-04-07 v1

摘要

许多现代基于视频的人类动作识别(HAR)方法使用 2D 骨架作为其预测管道中的中间表示。尽管总体而言取得鼓舞人心的效果,但这些方法在许多常见场景仍然难以处理,主要原因是骨架未能捕捉与动作相关的关键信息,包括关节的深度、人体轮廓以及人与物体之间的相互作用。为此,我们提出了一种有效的方法,通过一种捕捉动作相关信息的表示来增强骨架,以增强 HAR 管道。该表示称为 Scale-Body-Flow(SBF),由三个 distinct 组成部分构成:即给定每个关节比例(因此深度信息)的比例图体积、描绘人体主体的 body 图、以及由像素级光流值指示人与物体相互作用的 flow 图。为预测 SBF,我们进一步提出了 SFSNet,一个在无需额外标注的前提下,以骨架和光流为监督的新型分割网络。广泛的实验表明,我们基于 SBF 和 SFSNet 的管道在不同数据集上实现了显著更高的 HAR 准确率,同时保持了与最先进仅骨架方法相当的紧凑性和效率。

关键词

引用

@article{arxiv.2604.03590,
  title  = {SBF: An Effective Representation to Augment Skeleton for Video-based Human Action Recognition},
  author = {Zhuoxuan Peng and Yiyi Ding and Yang Lin and S. -H. Gary Chan},
  journal= {arXiv preprint arXiv:2604.03590},
  year   = {2026}
}

备注

Accepted by ABAW2026 (CVPR Workshop)