中文

基于课程策略的高效跨域动作识别

计算机视觉与模式识别 2026-01-21 v1

摘要

尽管在人体动作识别方面取得了显著进展,但泛化到多样化的视角仍然是一个挑战。大多数现有数据集是从地面视角捕获的,在其上训练的模型通常难以迁移到截然不同的领域,例如航拍视角。本文研究了基于课程的训练策略如何在不使用任何真实航拍数据训练的情况下,提高对未见过的真实航拍数据的泛化能力。我们使用两种域外数据源探索了跨视角动作识别的课程学习:合成航拍数据和真实地面数据。我们对训练顺序(在合成航拍数据与真实地面数据上进行微调)的评估结果表明,两者都在真实地面数据上进行微调,但在从合成数据过渡到真实数据的方式上有所不同。第一种方法使用带有直接微调的两阶段课程,而第二种方法则应用了一个渐进式课程,在微调之前分多个阶段扩展数据集。我们使用SlowFast(基于CNN)和MViTv2(基于Transformer)架构在REMAG数据集上评估了这两种方法。结果表明,结合这两个域外数据集明显优于在单一域(无论是真实地面视角还是合成航拍视角)上的训练。两种课程策略在达到与简单数据集组合相当的Top-1准确率的同时,还提供了效率增益。通过两步微调方法,与简单组合相比,SlowFast实现了高达37%的迭代次数减少,MViTv2实现了高达30%的减少。相对于两步方法,多步渐进式方法进一步减少了迭代次数,SlowFast最多减少9%,MViTv2最多减少30%。这些发现表明,基于课程的训练可以在跨视角动作识别中保持可比性能(Top-1准确率在3%范围内),同时提高训练效率。

关键词

引用

@article{arxiv.2601.14101,
  title  = {Curriculum-Based Strategies for Efficient Cross-Domain Action Recognition},
  author = {Emily Kim and Allen Wu and Jessica Hodgins},
  journal= {arXiv preprint arXiv:2601.14101},
  year   = {2026}
}