中文

为何不使用教科书?知识增强的教学视频过程规划

计算机视觉与模式识别 2024-06-18 v2

摘要

本文探讨了智能体构建逻辑动作步骤序列的能力,从而组装出战略性的过程计划。该计划对于如真实生活教学视频所示,从初始视觉观测导航至目标视觉结果至关重要。现有工作通过广泛利用数据集中的各种信息源(如密集的中间视觉观测、过程名称或自然语言逐步指令)作为特征或监督信号,取得了部分成功。然而,由于步骤排序中隐含的因果约束以及多种可行计划固有的变异性,该任务仍然极具挑战性。为解决先前努力所忽视的这些复杂性,我们提出通过注入过程知识来增强智能体的能力。这种源自训练过程计划并被结构化为有向加权图的知识,使智能体能够更好地应对步骤排序及其潜在变异的复杂性。我们将该方法命名为 KEPP,这是一种新颖的知识增强过程规划系统,它利用从训练数据中提取的概率过程知识图,有效地充当训练领域的综合教科书。在三种广泛使用的数据集上进行的实验评估表明,在不同复杂度设置下,KEPP 仅需极少监督即可取得优越的最先进结果。

关键词

引用

@article{arxiv.2403.02782,
  title  = {Why Not Use Your Textbook? Knowledge-Enhanced Procedure Planning of Instructional Videos},
  author = {Kumaranage Ravindu Yasas Nagasinghe and Honglu Zhou and Malitha Gunawardhana and Martin Renqiang Min and Daniel Harari and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2403.02782},
  year   = {2024}
}

备注

8 pages, 6 figures, (supplementary material: 9 pages, 5 figures), accepted to CVPR 2024