中文

可微任务图学习:来自自我中心视频的程序性活动表示与在线错误检测

计算机视觉与模式识别 2025-01-10 v3

摘要

程序性活动是为实现特定目标而执行的关键步骤序列。它们对于构建能够有效辅助用户的智能体至关重要。在此背景下,任务图已成为程序性活动的一种人类可理解的表示,编码了关键步骤上的偏序关系。虽然以往的工作通常依赖手工制作的程序从视频中提取任务图,但在本文中,我们提出了一种基于边权重的直接最大似然优化的方法,该方法允许基于梯度的任务图学习,并且可以自然地嵌入到神经网络架构中。在CaptainCook4D数据集上的实验表明,我们的方法能够从观察到的动作序列中预测准确的任务图,相比之前的方法提升了+16.7%。由于所提出框架的可微性,我们还引入了一种基于特征的方法,旨在从关键步骤的文本或视频嵌入中预测任务图,我们观察到其中涌现出视频理解能力。通过我们的方法学习到的任务图还显著增强了程序性自我中心视频中的在线错误检测,在Assembly101-O和EPIC-Tent-O数据集上分别取得了+19.8%和+7.5%的显著提升。用于复现实验的代码可在https://github.com/fpv-iplab/Differentiable-Task-Graph-Learning获取。

关键词

引用

@article{arxiv.2406.01486,
  title  = {Differentiable Task Graph Learning: Procedural Activity Representation and Online Mistake Detection from Egocentric Videos},
  author = {Luigi Seminara and Giovanni Maria Farinella and Antonino Furnari},
  journal= {arXiv preprint arXiv:2406.01486},
  year   = {2025}
}