中文

用于基于骨架的人体交互识别的双流混合 CNN-Transformer 网络

计算机视觉与模式识别 2024-01-02 v1 人工智能

摘要

人体交互识别是识别特定情境下多个参与者之间交互动作的过程,旨在识别多个实体之间的动作交互及其含义。许多单一的卷积神经网络 (CNN) 存在问题,例如无法捕捉全局实例交互特征或训练困难,导致动作语义模糊。此外,Transformer 的计算复杂度不容忽视,且其捕捉图像中局部信息和运动特征的能力较差。在本工作中,我们提出了一种双流混合 CNN-Transformer 网络 (THCT-Net),利用 CNN 的局部特异性并通过 Transformer 建模全局依赖关系。CNN 和 Transformer 分别同时对交互实体之间的实体、时间和空间关系进行建模。具体而言,基于 Transformer 的流集成了 3D 卷积与多头自注意力机制以学习 token 间的相关性;我们为基于 CNN 的流提出了一种新的多分支 CNN 框架,可从骨架序列中自动学习联合时空特征。卷积层独立学习每个关节邻域的局部特征并聚合所有关节的特征。此外,原始骨架坐标及其时间差分通过双分支范式进行整合,以融合骨架的运动特征。另外,添加了残差结构以加速训练收敛。最后,使用并行拼接融合两个分支的识别结果。在多样且具有挑战性的数据集上的实验结果表明,所提出的方法能更好地理解和推断各种动作的含义与上下文,性能优于最先进的方法。

关键词

引用

@article{arxiv.2401.00409,
  title  = {A Two-stream Hybrid CNN-Transformer Network for Skeleton-based Human Interaction Recognition},
  author = {Ruoqi Yin and Jianqin Yin},
  journal= {arXiv preprint arXiv:2401.00409},
  year   = {2024}
}