中文

基于图的多模态和多视图对齐用于步态识别

计算机视觉与模式识别 2026-02-11 v2

摘要

从佩戴者视角捕获的镜像视频具有动态背景、频繁运动和遮挡,给 accurate 步态识别带来挑战。我们提出了一种灵活的图学习框架,用于细粒度步态识别,能够有效利用镜像视频中的长期依赖关系,并在训练期间利用镜像视频与非镜像视频之间的对齐,以提高镜像视频上的推断性能。我们的方法包括构建一个图,其中每个镜像视频片段对应一个节点。在训练期间,将每个非镜像视频的每个片段视为额外的节点。我们检查了定义这些节点之间连接的多种策略,并将步态识别作为构建图上的节点分类任务。我们在 Ego-Exo4D 数据集上进行了大量实验,表明我们提出的灵活图基框架在准确率上显著优于现有方法超过 12 分。此外,构建的图稀疏且计算效率高。我们还 presenting 了一项研究,探讨了在异构图上利用包括叙述、深度和目标类别标签在内的多种多模态特征,讨论了这些特征对步态识别性能的相应贡献。

关键词

引用

@article{arxiv.2501.04121,
  title  = {Graph-Based Multimodal and Multi-view Alignment for Keystep Recognition},
  author = {Julia Lee Romero and Kyle Min and Subarna Tripathi and Morteza Karimzadeh},
  journal= {arXiv preprint arXiv:2501.04121},
  year   = {2026}
}

备注

We expanded the paper and resubmitted as a separate submission to arXiv. This submission is outdated and readers can refer to arXiv:2506.01102