LEAP:基于 LLM 的自我中心动作程序生成
计算机视觉与模式识别
2023-12-04 v1 机器学习
机器人学
摘要
我们提出 LEAP(如图 1 所示),一种通过使用大语言模型(LLM)生成视频接地动作程序的新方法。这些动作程序表征动作的运动、感知与结构方面,并由子动作、前条件与后条件以及控制流组成。LEAP 的动作程序以自我中心视频为中心,并利用 LLM 近期进展,既作为其程序知识的来源,也作为多模态视频信息的聚合器与评估器。我们将 LEAP 应用于 EPIC Kitchens 数据集训练集的绝大部分(87%),并将所得动作程序作为公开可用数据集发布于此(https://drive.google.com/drive/folders/1Cpkw_TI1IIxXdzor0pOXG3rWJWuKU5Ex?usp=drive_link)。我们将 LEAP 用作辅助监督来源,将其动作程序用于应用于动作识别与预测网络的损失项中。我们展示了由于使用 LEAP 数据集训练,两项任务性能均得到大幅提升。我们的方法在截至 11 月 17 日的 EPIC Kitchens 动作识别排行榜上,于仅限 RGB 输入的网络中取得第 1 名(见补充材料)。
引用
@article{arxiv.2312.00055,
title = {LEAP: LLM-Generation of Egocentric Action Programs},
author = {Eadom Dessalene and Michael Maynord and Cornelia Fermüller and Yiannis Aloimonos},
journal= {arXiv preprint arXiv:2312.00055},
year = {2023}
}
备注
Dataset: https://drive.google.com/drive/folders/1Cpkw_TI1IIxXdzor0pOXG3rWJWuKU5Ex?usp=drive_link