中文

REMAP:基于正则化匹配与部分对齐的视频嵌入

计算机视觉与模式识别 2026-05-08 v2 人工智能

摘要

现实世界的 instructional video 往往较长、噪声较大,且包含大量背景段落、重复动作以及不对应于有意义程序步骤的执行变异性。我们提出 **REMAP**,一个基于 *Regularized Fused Partial Gromov-Wasserstein Optimal Transport* 的无监督程序学习框架。REMAP 放宽平衡运输约束,允许非信息性或冗余帧保持未匹配状态,通过部分运输实现。该方法联合建模语义相似性和时间结构,并纳入拉普拉斯基平滑和结构正则化,以防止退化对齐并减少背景干扰。我们在大规模 egocentric 和 third-person 基准测试上评估了 REMAP。该方法在 EgoProceL 上 consistently优于最先进的方法,实现了最高可达 **11.6%(+4.45pp)** 的 F1 和 **19.6%(+4.73pp)** 的 IoU 提升,在 ProceL 和 CrossTask 上实现平均 **41%(+17.15pp)** 的 F1 增益。这些结果凸显了在处理现实世界程序变异性方面,部分对齐的重要性,并表明 REMAP 提供了一种稳健且可扩展的教学视频理解方法。

关键词

引用

@article{arxiv.2509.24382,
  title  = {REMAP: Regularized Matching and Partial Alignment of Video Embeddings},
  author = {Soumyadeep Chandra and Kaushik Roy},
  journal= {arXiv preprint arXiv:2509.24382},
  year   = {2026}
}

备注

9 pages, 4 figures, 6 tables