中文

以太ocentric 视觉语言规划

计算机视觉与模式识别 2024-08-13 v1

摘要

我们探索利用大型多模态模型(LMM)和 text2image 模型来构建更通用的具身智能体。LMM 在对符号抽象进行的长期任务规划方面表现突出,但在与物理世界的 grounding 方面常常失败,难以准确识别图像中的物体位置。需要一个桥梁将 LMM 与物理世界连接起来。本文提出了一种新方法,即以 egocentric 视角处理各种家庭场景中的长期任务——即 egocentric 视觉语言规划(EgoPlan)。该模型利用扩散模型模拟状态与动作之间的基本动力学,集成 style transfer 和光流技术以增强跨不同环境动力学的 generalization。LMM 作为规划器,将指令分解为子目标,并根据这些子目标与动作的 alignment 选择动作,从而实现更通用和有效的决策。实验表明,EgoPlan 在家庭场景中,从 egocentric 视角提高了长期任务成功率,优于基线方法。

关键词

引用

@article{arxiv.2408.05802,
  title  = {Egocentric Vision Language Planning},
  author = {Zhirui Fang and Ming Yang and Weishuai Zeng and Boyu Li and Junpeng Yue and Ziluo Ding and Xiu Li and Zongqing Lu},
  journal= {arXiv preprint arXiv:2408.05802},
  year   = {2024}
}