VoyagerVision:多模态信息在开放式学习系统中的作用探讨
人工智能
2025-07-02 v1 机器学习
摘要
开放式是人工智能通用智能(AGI) pursuit 中活跃的研究领域,允许模型自行选择任务。同时,近期涌现的大型语言模型(如GPT-4o)已能够解译图像输入。诸如OMNI-EPIC等实现已运用此类功能,为LLM提供代理视角(POV)的像素数据,以解析环境并使其解决任务。本文提议,为模型提供此类视觉输入可赋予其更大的能力去解释空间环境,从而增加其成功执行任务的数量,延伸其开放式潜能。为此目的,本文提出VoyagerVision——一种能够利用截图作为视觉反馈在Minecraft中创建结构的多模态模型,基于Voyager的基础构建。VoyagerVision在系统执行五十次迭代后,能够创建平均2.75个独特结构,而Voyager则无法实现。这表明VoyagerVision在全新方向上实现了显著扩展。此外,在一组建筑单元测试中,VoyagerVision在平坦世界中成功了一半的所有尝试,大多数失败发生在更复杂的结构上。项目网站可访问 https://esmyth-dev.github.io/VoyagerVision.github.io/。
引用
@article{arxiv.2507.00079,
title = {VoyagerVision: Investigating the Role of Multi-modal Information for Open-ended Learning Systems},
author = {Ethan Smyth and Alessandro Suglia},
journal= {arXiv preprint arXiv:2507.00079},
year = {2025}
}
备注
website: https://esmyth-dev.github.io/VoyagerVision.github.io/