破解行动密码:基于强化学习的生成性方法获取可 affordances
人工智能
2025-04-25 v1
摘要
能够通过统一的行动空间(例如鼠标和键盘动作)在图形用户界面(GUI)上自主导航的智能体往往需要 substantial 数量的领域特定专家演示才能实现良好性能。在稀疏奖励和大行动空间环境中(如 web GUI),只有少数动作在给定情境下才是 relevant的,这会加剧样本效率低的问题。在本工作中,我们聚焦于 limited 或没有专家行为访问的 low-data 场景。为实现样本高效学习,我们探索了通过约束行动空间来产生效果的做法,即在任何情境下仅考虑实现预期结果的子集动作。我们提出了 Code as Generative Affordances(CoGA)方法,利用预训练的视觉语言模型(VLMs)生成代码,通过隐式意图完成函数来确定可 affordances 的动作,并使用全自动的程序生成和验证管道。这些程序随后被用于强化学习智能体的内部循环,以给定像素观察返回一组 affordances。通过大幅度减少智能体必须考虑的动作数量,我们在 MiniWob++基准测试中展示了 CoGA 在广泛任务上的效果:① CoGA 在其 RL 智能体之上快一个数量级的样本效率;② CoGA 的程序可以在任务家族内部实现泛化;③ 在有限数量的专家演示可用时,CoGA 的性能与行为模仿相当或更好。
引用
@article{arxiv.2504.17282,
title = {Cracking the Code of Action: a Generative Approach to Affordances for Reinforcement Learning},
author = {Lynn Cherif and Flemming Kondrup and David Venuto and Ankit Anand and Doina Precup and Khimya Khetarpal},
journal= {arXiv preprint arXiv:2504.17282},
year = {2025}
}