中文

Proposer-Agent-Evaluator(PAE):面向基础模型互联网智能体的自主技能发现

机器学习 2024-12-18 v1 人工智能 计算机视觉与模式识别

摘要

得益于基础模型的泛化能力,具备广泛能力且目标导向的智能体(如数字世界中浏览互联网的智能体和物理世界中的家庭人形机器人)的愿景已迅速发展。此类通用智能体需要具备庞大且多样的技能库,例如在两个出行地点间查找路线以及从互联网上购买特定商品。如果每项技能都需要通过固定的人工标注指令集来手动指定,由于人工标注指令在数量和多样性上的局限,智能体的技能库必然受限。在本工作中,我们通过提出 Proposer-Agent-Evaluator 来应对这一挑战,这是一种有效的学习系统,使基础模型智能体能够在真实环境中自主发现并练习技能。PAE 的核心是一个上下文感知任务提议器,它利用环境的上下文信息(如用户演示,甚至仅是互联网浏览智能体所访问网站的名称)自主为智能体提议任务以供练习。然后,智能体策略在真实世界中通过思考和实际接地操作来尝试这些任务,产生的轨迹由基于 VLM 的自主成功评估器进行评估。成功评估作为奖励信号,供智能体通过 RL 改进其策略。我们在具有挑战性的基于视觉的网页导航上验证了 PAE,使用了来自 WebVoyager 和 WebArena 的真实世界与自托管网站。据我们所知,这项工作代表了首个将自主任务提议与 RL 应用于智能体的有效学习系统,并在真实世界人工标注基准上取得了 SOTA 性能。我们的开源检查点和代码可在 https://yanqval.github.io/PAE/ 找到。

关键词

引用

@article{arxiv.2412.13194,
  title  = {Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents},
  author = {Yifei Zhou and Qianlan Yang and Kaixiang Lin and Min Bai and Xiong Zhou and Yu-Xiong Wang and Sergey Levine and Erran Li},
  journal= {arXiv preprint arXiv:2412.13194},
  year   = {2024}
}