中文

AntGPT:大语言模型能否辅助视频长时动作预测?

计算机视觉与模式识别 2024-04-02 v3

摘要

如果我们已知某演员当前动作(如打鸡蛋)之后通常会发生什么(如搅拌鸡蛋),能否更好地预测其未来动作?如果我们还知道该演员的长期目标(如做蛋炒饭)呢?长时动作预测(LTA)任务旨在以动词和名词序列的形式从视频观测中预测演员的未来行为,这对于人机交互至关重要。我们提出从两个视角来构建LTA任务:自底向上的方法,通过建模时间动态以自回归方式预测下一步动作;以及自顶向下的方法,推断演员的目标并规划达成目标所需的步骤。我们假设,已在过程性文本数据(如菜谱、操作指南)上预训练的大语言模型(LLMs)有潜力从两个视角辅助LTA。它可分别提供关于可能下一步动作的先验知识,以及在给定观测到的部分过程时推断目标。为利用LLMs,我们提出了一个两阶段框架AntGPT。它首先识别已观测视频中已执行的动作,然后要求LLM通过条件生成预测未来动作,或通过思维链提示推断目标并规划整个过程。在Ego4D LTA v1和v2基准、EPIC-Kitchens-55以及EGTEA GAZE+上的实证结果证明了我们提出方法的有效性。AntGPT在上述所有基准上均取得了最先进(SOTA)性能,并可通过定性分析成功推断目标从而进行目标条件的“反事实”预测。代码与模型将于 https://brown-palm.github.io/AntGPT 发布。

关键词

引用

@article{arxiv.2307.16368,
  title  = {AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?},
  author = {Qi Zhao and Shijie Wang and Ce Zhang and Changcheng Fu and Minh Quan Do and Nakul Agarwal and Kwonjoon Lee and Chen Sun},
  journal= {arXiv preprint arXiv:2307.16368},
  year   = {2024}
}

备注

ICLR 2024 Camera Ready