基于大语言模型、融合视觉信息与预测导向提示的具身世界模型
人工智能
2024-06-05 v1 计算与语言
摘要
近年来,随着机器学习(特别是视觉和语言理解)的进步,嵌入式AI的研究也得到了发展。VOYAGER是一种著名的基于LLM的具身AI,能够在Minecraft世界中自主探索,但它存在视觉数据利用不足和作为世界模型功能不足等问题。在本研究中,我们探讨了利用视觉数据和LLM作为世界模型的功能的可能性,旨在提高具身AI的性能。实验结果表明,LLM可以从视觉数据中提取必要信息,并且利用这些信息可以提高其作为世界模型的性能。此外,还表明精心设计的提示可以激发LLM作为世界模型的功能。
引用
@article{arxiv.2406.00765,
title = {The Embodied World Model Based on LLM with Visual Information and Prediction-Oriented Prompts},
author = {Wakana Haijima and Kou Nakakubo and Masahiro Suzuki and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2406.00765},
year = {2024}
}