面向硬性探索任务的LLM代理双尺度世界模型
计算与语言
2025-10-01 v2
摘要
LLM-based代理取得了令人鼓舞的进展,但在需要通过探索学习新知识的"硬性探索"任务中仍受限。我们提出GLoW,一种利用双尺度世界模型的新方法,维持全球尺度上高价值发现的轨迹前沿,同时通过多路径优势反思机制在局部试错中进行探索,该机制推断优势基准信号以指导探索。为评估在硬性探索任务中的框架,我们针对Jericho文本游戏基准套件进行测试,GLoW实现了LLM-based方法的新型态最佳性能。相较于基于RL的方法,Our方法在仅需环境交互次数的100-800倍时即可实现相当的性能。
引用
@article{arxiv.2509.24116,
title = {Dual-Scale World Models for LLM Agents Towards Hard-Exploration Problems},
author = {Minsoo Kim and Seung-won Hwang},
journal= {arXiv preprint arXiv:2509.24116},
year = {2025}
}