中文

LEAP:基于 LLM 的自我中心动作程序生成

计算机视觉与模式识别 2023-12-04 v1 机器学习 机器人学

摘要

我们提出 LEAP(如图 1 所示),一种通过使用大语言模型(LLM)生成视频接地动作程序的新方法。这些动作程序表征动作的运动、感知与结构方面,并由子动作、前条件与后条件以及控制流组成。LEAP 的动作程序以自我中心视频为中心,并利用 LLM 近期进展,既作为其程序知识的来源,也作为多模态视频信息的聚合器与评估器。我们将 LEAP 应用于 EPIC Kitchens 数据集训练集的绝大部分(87%),并将所得动作程序作为公开可用数据集发布于此(https://drive.google.com/drive/folders/1Cpkw_TI1IIxXdzor0pOXG3rWJWuKU5Ex?usp=drive_link)。我们将 LEAP 用作辅助监督来源,将其动作程序用于应用于动作识别与预测网络的损失项中。我们展示了由于使用 LEAP 数据集训练,两项任务性能均得到大幅提升。我们的方法在截至 11 月 17 日的 EPIC Kitchens 动作识别排行榜上,于仅限 RGB 输入的网络中取得第 1 名(见补充材料)。

关键词

引用

@article{arxiv.2312.00055,
  title  = {LEAP: LLM-Generation of Egocentric Action Programs},
  author = {Eadom Dessalene and Michael Maynord and Cornelia Fermüller and Yiannis Aloimonos},
  journal= {arXiv preprint arXiv:2312.00055},
  year   = {2023}
}

备注

Dataset: https://drive.google.com/drive/folders/1Cpkw_TI1IIxXdzor0pOXG3rWJWuKU5Ex?usp=drive_link