中文

多视角可变形聚合的主干-分支对比网络用于多视角动作识别

计算机视觉与模式识别 2025-02-25 v1

摘要

多视角动作识别旨在识别给定多视角场景中的动作。传统研究首先从每个视角提取精细特征,随后进行配对交互与融合,但可能忽略了每个视角中的关键局部特征。当从多个视角观察物体时,人们通常会形成整体印象,随后再补充具体细节。受这一认知过程启发,我们提出了一种新颖的主干-分支对比网络(TBCNet),用于基于RGB的多视角动作识别。显著地,TBCNet首先在主干块中获取融合特征,然后通过对比学习隐式地补充由分支块提供的关键细节,从而生成信息更丰富、更全面的动作表示。在该框架中,我们构建了两个核心组件:多视角可变形聚合和主干-分支对比学习。主干块中采用的多视角可变形聚合有效促进了多视角特征融合与自适应的跨视角时空相关性,其中全局聚合模块用于强调显著的空间信息,复合相对位置偏置用于捕获视角内和跨视角的相对位置。此外,在聚合特征与每个视角的精细细节之间构建了主干-分支对比损失。通过为正负样本引入两种不同的权重,提出了加权主干-分支对比损失,以提取有价值的信息并强调细微的类间差异。TBCNet的有效性通过在NTU-RGB+D 60、NTU-RGB+D 120、PKU-MMD和N-UCLA四个数据集上的广泛实验得到验证。与其他基于RGB的方法相比,我们的方法在跨主体和跨设置协议下达到了最先进的性能。

关键词

引用

@article{arxiv.2502.16493,
  title  = {Trunk-branch Contrastive Network with Multi-view Deformable Aggregation for Multi-view Action Recognition},
  author = {Yingyuan Yang and Guoyuan Liang and Can Wang and Xiaojun Wu},
  journal= {arXiv preprint arXiv:2502.16493},
  year   = {2025}
}