中文

提出、评估、搜索:利用大语言模型进行教学视频中的目标导向规划

计算机视觉与模式识别 2024-10-01 v1

摘要

目标导向规划,即预测从当前状态到预定目标的一系列动作,对于开发能够辅助用户完成日常程序性任务的智能助手至关重要。该问题由于需要对任务的时间层次结构有全面的理解,以及具备强大的推理和规划能力,因此极具挑战性。为实现这一目标,先前的工作通常依赖于在目标数据集上进行大量训练,这往往导致显著的 dataset bias 和对未见任务的泛化能力不足。在本工作中,我们引入了 VidAssist,一个为教学视频中零样本/少样本目标导向规划而设计的集成框架。VidAssist 利用大语言模型 (LLM) 同时作为知识库和评估工具,用于生成和评估动作计划,从而克服了从小规模、低多样性数据集中获取程序性知识的挑战。此外,VidAssist 采用广度优先搜索算法进行最优计划生成,其中使用一组为目标导向规划设计的价值函数组合来评估每一步的预测动作。大量实验表明,VidAssist 为不同的目标导向规划设置(例如,辅助视觉规划 (VPA) 和程序规划 (PP))提供了一个统一框架,并在零样本和少样本设置中取得了显著性能。具体来说,在 COIN 数据集上预测 4 个未来动作时,我们的少样本模型在 VPA 和 PP 任务上分别比先前全监督的最先进方法高出 +7.7% 和 +4.81%。代码和模型可在 https://sites.google.com/view/vidassist 公开获取。

关键词

引用

@article{arxiv.2409.20557,
  title  = {Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos},
  author = {Md Mohaiminul Islam and Tushar Nagarajan and Huiyu Wang and Fu-Jen Chu and Kris Kitani and Gedas Bertasius and Xitong Yang},
  journal= {arXiv preprint arXiv:2409.20557},
  year   = {2024}
}

备注

Accepted by ECCV 2024 (Oral)