中文

基于深度核的视频无监督动作分割

计算机视觉与模式识别 2026-04-24 v1

摘要

本工作聚焦于视频级别的无监督动作分割,该方法在存储大型数据集不可行或不被允许的应用场景中具有重要意义。我们提出通过在深度核空间中学习来分割视频,以尽可能贴近原始视频分布的近似。为定义原始视频分布与其近似之间的这种贴近度度量标准,我们依赖最大均值不等式(MMD),该度量在分布空间中保持几何特性,因此提供更可靠的估计。此外,与常用的最优传输度量不同,MMD更易优化且更快。我们选择使用神经张量核(NTK)来定义MMD操作的核空间,因为它们相对于固定核具有更好的描述能力;同时,NTK规避了在联合学习输入(视频近似)和核函数时出现的平凡解。最终,我们在六个标准基准测试上显示出与最先进方法的竞争成绩。此外,在分段数量未知的情况下,我们的方法在F1分数上优于以往的层级方法。

关键词

引用

@article{arxiv.2604.21572,
  title  = {Deep kernel video approximation for unsupervised action segmentation},
  author = {Silvia L. Pintea and Jouke Dijkstra},
  journal= {arXiv preprint arXiv:2604.21572},
  year   = {2026}
}

备注

Accepted at ICPR 2026