中文

融合大语言模型灵感的世界模型用于目标实现

人工智能 2024-06-12 v1 机器学习

摘要

强化学习在面对长期任务和稀疏目标时因难以手动指定奖励函数而受限。虽然现有方法通过添加内在奖励来缓解,但在大状态空间和动作空间的长期决策任务中可能无法提供有意义的指导,缺乏目的性探索。以人类认知为灵感,我们提出一种新的多模态模型基强化学习方法,称为大语言模型驱动的梦境(DLLM)。DLLM将来自大语言模型的启发式子目标整合到模型滚动中,以鼓励目标发现和实现。在模型滚动期间,DLLM通过对与语言模型所述启发式相吻合的样本分配更高的内在奖励,引导智能体向有意义且高效的探索。广泛实验表明,DLLM在各种具有挑战性的稀疏奖励环境中(如HomeGrid、Crafter和Minecraft)分别优于最新方法的27.7%、21.1%和9.9%。

关键词

引用

@article{arxiv.2406.07381,
  title  = {World Models with Hints of Large Language Models for Goal Achieving},
  author = {Zeyuan Liu and Ziyu Huan and Xiyao Wang and Jiafei Lyu and Jian Tao and Xiu Li and Furong Huang and Huazhe Xu},
  journal= {arXiv preprint arXiv:2406.07381},
  year   = {2024}
}