中文

Trokens:面向少样本动作识别的语义感知关系轨迹标记

计算机视觉与模式识别 2025-08-06 v1

摘要

视频理解需要有效地建模运动和外观信息,尤其是在少样本动作识别中。尽管最近的基于点追踪的研究在提升少样本动作识别方面取得了显著进展,但仍存在两个根本性挑战:如何选择有效的跟踪点以及如何有效地建模其运动模式。我们提出了Trokens方法,通过将轨迹点转化为语义感知关系标记来实现动作识别。首先,我们引入语义感知采样策略,依据物体尺度和语义相关性自适应分布跟踪点。其次,我们开发了运动建模框架,通过直方图式有向位移(HoD)捕捉轨迹内部的动态,并建模轨迹之间的相互关系,以刻画复杂的动作模式。我们的方法有效地将这些轨迹标记与语义特征结合,增强了外观特征中的运动信息,在六个 diverse 的少样本动作识别基准(包括 Something-Something-V2 的完整和小型划分、Kinetics、UCF101、HMDB51 和 FineGym)上实现了最先进的性能。项目页面请参见 https://trokens-iccv25.github.io

关键词

引用

@article{arxiv.2508.03695,
  title  = {Trokens: Semantic-Aware Relational Trajectory Tokens for Few-Shot Action Recognition},
  author = {Pulkit Kumar and Shuaiyi Huang and Matthew Walmer and Sai Saketh Rambhatla and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2508.03695},
  year   = {2025}
}

备注

Accepted at ICCV 2025; First two authors contributed equally