使用图神经网络进行关键步骤识别
计算机视觉与模式识别
2026-02-11 v1
摘要
我们将关键步骤识别视为一个节点分类任务,并提出了一种灵活的图学习框架用于细粒度关键步骤识别,该框架能够有效利用第一人称视角视频中的长期依赖关系。我们的方法称为 GLEVR,其核心是构建一个图,其中第一人称视角视频的每个视频片段对应一个节点。构建的图是稀疏且计算高效的,在性能上大幅超越了现有的大型模型。我们进一步在训练期间利用第一人称视角与第三人称视角视频之间的对齐关系,以改善第一人称视角视频的推理效果,并加入自动字幕生成作为附加模态。在训练期间,我们将每个第三人称视角视频的每个片段(如果可用)或视频字幕视为附加节点。我们研究了几种定义这些节点间连接的策略。我们在 Ego-Exo4D 数据集上进行了大量实验,结果表明我们提出的灵活的基于图的框架显著优于现有方法。
引用
@article{arxiv.2506.01102,
title = {Keystep Recognition using Graph Neural Networks},
author = {Julia Lee Romero and Kyle Min and Subarna Tripathi and Morteza Karimzadeh},
journal= {arXiv preprint arXiv:2506.01102},
year = {2026}
}