面向未知环境的自学习具身大语言模型
机器学习
2024-10-07 v1 计算机视觉与模式识别
摘要
近年来,多模态大语言模型(MLLMs)在视觉理解与决策方面展现出强劲能力,推动了探索在未知环境中自主提升 MLLM 的可能性。然而,外部反馈如人类反馈或环境反馈并始终可用。为此,现有方法主要致力于通过投票与评分机制提升 MLLM 的决策能力,却很少关注提升 MLLM 在未知环境中的环境理解能力。为充分发挥 MLLM 的自学习潜力,我们提出一种新颖的演员-评论家自学习范式,称为 SELU(Self-Learning Embodied MLLMs in Unknown Environments),灵感来自强化学习中的演员-评论家范式。评论家采用自提问与 hindsight 重标技术,从演员收集的交互轨迹中提取知识,从而增强其环境理解。同时,演员通过评论家提供的自我反馈进行改进,提升其决策能力。我们在 AI2-THOR 与 VirtualHome 环境中进行评估,结果显示 SELU 通过自学习实现了约 28% 与 30% 的评论家提升,以及约 20% 与 24% 的演员提升。
引用
@article{arxiv.2410.03303,
title = {SELU: Self-Learning Embodied MLLMs in Unknown Environments},
author = {Boyu Li and Haobin Jiang and Ziluo Ding and Xinrun Xu and Haoran Li and Dongbin Zhao and Zongqing Lu},
journal= {arXiv preprint arXiv:2410.03303},
year = {2024}
}