中文

通过显式相似性度量改进动作分割

计算机视觉与模式识别 2025-02-18 v1

摘要

现有的有监督动作分割方法依赖于使用注意力机制或时间卷积捕获时间依赖性的逐帧分类质量。即使是基于边界检测的方法也主要依赖于初始逐帧分类的准确性,在预测质量较低的情况下,可能会忽略对片段和边界的精确识别。为了解决这个问题,本文提出了 ASESM(基于显式相似性度量的动作分割),通过在帧和预测之间引入显式相似性评估来提高分割准确性。我们的有监督学习架构使用帧级多分辨率特征作为多个 Transformer 编码器的输入。生成的多个逐帧预测用于相似性投票,以获得高质量的初始预测。我们应用了一种新提出的边界校正算法,该算法基于连续帧之间的特征相似性运行,通过学习过程迭代调整边界位置。校正后的预测随后通过多阶段的时间卷积进行进一步细化。作为后处理,我们选择性地再次应用边界校正,随后采用片段平滑方法,利用连续预测之间的相似性测量去除片段内的异常类。此外,我们提出了一种完全无监督的边界检测-校正算法,该算法仅基于特征相似性识别片段边界,无需任何训练。在 50Salads、GTEA 和 Breakfast 数据集上的实验表明了有监督和无监督算法的有效性。代码和模型已在 Github 上公开。

关键词

引用

@article{arxiv.2502.10713,
  title  = {Improving action segmentation via explicit similarity measurement},
  author = {Kamel Aouaidjia and Wenhao Zhang and Aofan Li and Chongsheng Zhang},
  journal= {arXiv preprint arXiv:2502.10713},
  year   = {2025}
}

备注

13 pages, 5 figures