中文

基于层次向量量化的无监督动作分割

计算机视觉与模式识别 2025-01-27 v2

摘要

本文解决无监督temporal动作分割问题,即将一组长度未裁剪的视频分割为跨视频一致的语义有意义的片段。虽然最近的方法尝试在单一步骤中组合表示学习和聚类,但它们无法处理同一类别时间片段内的大幅变异。为此,我们提出一种新方法,称为层次向量量化(HVQ),由两个后续向量量化模块组成。这导致一种层次聚类,其中额外的子簇覆盖簇内的变异。我们展示,您的方法比现有方法更好地捕捉了片段长度的分布。为此,我们引入一种基于Jensen-Shannon距离(JSD)的新指标,用于无监督temporal动作分割。我们在三个公共数据集上评估了该方法,即Breakfast、YouTube Instructional和IKEA ASM。我们的做法在F1分数、召回率和JSD方面均优于现有的技术。

关键词

引用

@article{arxiv.2412.17640,
  title  = {Hierarchical Vector Quantization for Unsupervised Action Segmentation},
  author = {Federico Spurio and Emad Bahrami and Gianpiero Francesca and Juergen Gall},
  journal= {arXiv preprint arXiv:2412.17640},
  year   = {2025}
}

备注

To be published in Conference on Artificial Intelligence (AAAI) 2025