中文

GePSAn:烹饪视频中的生成式步骤预测

计算机视觉与模式识别 2023-10-13 v1 机器学习

摘要

我们研究过程视频中的未来步骤预测问题。给定一段正在进行过程活动的视频,我们预测以丰富自然语言描述的合理下一步骤。尽管以往多数工作聚焦于过程视频数据集中的数据稀缺问题,未来预测的另一核心挑战是如何在自然场景中考虑多种合理的未来实现方式。该问题在以往工作中很大程度上被忽视。为应对此挑战,我们将未来步骤预测构建为对下一步所有可能候选者分布的建模。具体而言,我们设计了一个生成模型,以一系列视频片段作为输入,并生成多个合理且多样的下一步候选(以自然语言表示)。遵循以往工作,我们通过在大规基于文本的过程活动语料库上预训练模型,再将模型迁移至视频领域,从而规避视频标注稀缺问题。我们在文本与视频领域的实验均表明,我们的模型捕捉了下一步预测中的多样性并生成多个合理的未来预测。此外,我们的模型在YouCookII上确立了新的state-of-the-art结果,在下一步预测上优于现有基线。最后,我们还展示模型可成功从文本零样本迁移至视频领域,即无需微调或适配,便能从视频生成高质量的未来步骤预测。

关键词

引用

@article{arxiv.2310.08312,
  title  = {GePSAn: Generative Procedure Step Anticipation in Cooking Videos},
  author = {Mohamed Ashraf Abdelsalam and Samrudhdhi B. Rangrej and Isma Hadji and Nikita Dvornik and Konstantinos G. Derpanis and Afsaneh Fazly},
  journal= {arXiv preprint arXiv:2310.08312},
  year   = {2023}
}

备注

published at ICCV 2023