中文

联合自监督视频对齐与动作分割

计算机视觉与模式识别 2025-12-08 v3

摘要

我们提出了一种基于统一最优传输框架的自监督视频对齐和动作分割联合方法。具体而言,我们首先通过开发带结构先验的融合Gromov-Wasserstein最优传输公式来处理自监督视频对齐,该方法在GPU上高效训练,只需少数迭代即可求解最优传输问题。我们的单任务方法在多个视频对齐基准测试上实现了最先进的性能,优于依赖 optimality 先验的传统Kantorovich最优传输公式的VAVA。此外,我们提出了统一的最优传输框架,用于联合自监督视频对齐和动作分割,该方法只需训练和存储一个模型,相较于两个不同单任务模型在时间和内存消耗方面具有显著优势。在多个视频对齐和动作分割数据集上进行的广泛评估表明,我们的多任务方法在视频对齐和动作分割任务上均实现了与先前方法相当甚至更好的性能。最后,在我们看来,这是首个将视频对齐和动作分割统一到单个模型中的工作。我们的代码已在研究网站 https://retrocausal.ai/research/ 上提供。

关键词

引用

@article{arxiv.2503.16832,
  title  = {Joint Self-Supervised Video Alignment and Action Segmentation},
  author = {Ali Shah Ali and Syed Ahmed Mahmood and Mubin Saeed and Andrey Konin and M. Zeeshan Zia and Quoc-Huy Tran},
  journal= {arXiv preprint arXiv:2503.16832},
  year   = {2025}
}

备注

Accepted to ICCV 2025