中文

无训练的在线视频步骤定位

计算机视觉与模式识别 2025-10-21 v1

摘要

给定任务及其组成步骤的一组步骤,视频步骤定位 (VSG) 旨在检测哪些步骤在视频中被执行。标准方法需要标注训练集(例如带有步骤级别注释或叙述),这可能需要高昂的成本来收集。此外,它们处理整个视频离线,限制了需要在线决策的场景的应用。因此,本文探索如何在没有训练的情况下进行在线 VSG。我们通过利用最近大型多模态模型 (LMM) 的零样图能力来实现这一点。具体而言,我们使用 LMM 对受限帧集进行预测,而无需访问整个视频。我们表明,这种无任务特定微调的在线策略在离线和基于训练的方法上均取得优异性能。受此启发,我们开发了基于大型多模态模型的贝叶斯定位 (BaGLM),进一步将过去帧的知识注入 LMM 预测。BaGLM 利用贝叶斯滤波原理,建模步骤转换通过(i)通过大型语言模型提取的依赖矩阵和(ii)步骤进度的估计。在三个数据集上的实验表明,BaGLM 在最先进的基于训练的离线方法上取得了优异性能。

关键词

引用

@article{arxiv.2510.16989,
  title  = {Training-free Online Video Step Grounding},
  author = {Luca Zanella and Massimiliano Mancini and Yiming Wang and Alessio Tonioni and Elisa Ricci},
  journal= {arXiv preprint arXiv:2510.16989},
  year   = {2025}
}

备注

NeurIPS 2025. Project website at https://lucazanella.github.io/baglm/