中文

青蛙汤:零样本、上下文内和样本高效的青蛙过河智能体

人工智能 2025-05-08 v1

摘要

强化学习研究的主要目标之一是开发能够快速适应并掌握新任务的通用智能体。虽然强化学习游戏智能体已经掌握了许多Atari游戏,但为每个游戏训练它们仍然缓慢且成本高昂。在这项工作中,我们展示了最新的推理大语言模型(LLM),经过域外RL后训练,可以在零样本设置下玩一款名为“青蛙过河”(Frogger)的具有挑战性的Atari游戏。然后,我们研究了上下文内学习和推理努力程度对LLM性能的影响。最后,我们展示了一种利用LLM演示来引导传统RL方法的方式,这显著提高了它们的性能和样本效率。我们的实现已在https://github.com/AlienKevin/frogger开源。

关键词

引用

@article{arxiv.2505.03947,
  title  = {Frog Soup: Zero-Shot, In-Context, and Sample-Efficient Frogger Agents},
  author = {Xiang Li and Yiyang Hao and Doug Fulop},
  journal= {arXiv preprint arXiv:2505.03947},
  year   = {2025}
}