FutureWorld:基于真实结果奖励的预测智能体活体强化学习环境
人工智能
2026-05-18 v4 机器学习
摘要
Live future prediction 指的是在事件发生之前对真实世界事件进行预测的任务。这一任务正逐渐采用基于大型语言模型的智能体系统进行研究,对构建能够从真实世界持续学习的智能体至关重要。它可以为多样化的真实世界事件提供大量预测问题,同时防止答案泄露。为了充分利用未来预测的优势,我们提出 FutureWorld,一个活体智能体强化学习环境,通过预测、结果实现和参数更新之间的闭环训练。具体而言,我们修改并扩展了 verl-tool,形成我们称为 verl-tool-future 的新框架。与依赖即时奖励的标准强化学习训练框架不同,verl-tool-future 存储预测时的 rollout,随后在真实世界结果可用后填充奖励,然后对完成的轨迹进行回放以进行策略更新。在三个开源智能体上,连续的 FutureWorld 训练轮次导致预测准确性、概率评分和校准水平的一致性改进,表明延迟的真实世界结果反馈可作为有效的强化学习信号。
引用
@article{arxiv.2604.26733,
title = {FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards},
author = {Zhixin Han and Yanzhi Zhang and Chuyang Wei and Maohang Gao and Xiawei Yue and Kefei Chen and Yu Zhuang and Haoxiang Guan and Jiyan He and Jian Li and Yitong Duan and Yu Shi and Mengting Hu and Shuxin Zheng},
journal= {arXiv preprint arXiv:2604.26733},
year = {2026}
}
备注
The code will be released in the near future. The experiments are currently ongoing