中文

EPD:长期记忆提取、上下文感知规划与多轮决策——ICML 2024 EgoPlan挑战赛

机器人学 2024-07-30 v1 计算机视觉与模式识别

摘要

在本文中,我们介绍了我们在ICML 2024 EgoPlan挑战赛中的解决方案。为了解决现实世界中的自我中心任务规划问题,我们提出了一种新颖的规划框架,该框架包含三个阶段:长期记忆提取、上下文感知规划和多轮决策,命名为EPD。给定任务目标、任务进度和当前观察,提取模型从进度视频中提取与任务相关的记忆信息,将复杂的长时间视频转换为简化的记忆信息。然后,规划模型将记忆信息的上下文与当前观察中的细粒度视觉信息相结合,以预测下一个动作。最后,通过多轮决策,决策模型全面理解任务情况和当前状态,以做出最现实的规划决策。在EgoPlan-Test集上,EPD在1,584个自我中心任务规划问题中达到了53.85%的规划准确率。我们已在https://github.com/Kkskkkr/EPD公开了所有代码。

关键词

引用

@article{arxiv.2407.19510,
  title  = {EPD: Long-term Memory Extraction, Context-awared Planning and Multi-iteration Decision @ EgoPlan Challenge ICML 2024},
  author = {Letian Shi and Qi Lv and Xiang Deng and Liqiang Nie},
  journal= {arXiv preprint arXiv:2407.19510},
  year   = {2024}
}