原型后继测度:强化学习智能体行为空间的表示
机器学习
2025-03-12 v2 人工智能
摘要
在探索环境后,智能体应能够在无需额外互动的情况下将其知识迁移到该环境内大多数下游任务,这被称为“零样本学习”。这种能力对通用强化学习算法仍然难以实现。虽然近期研究尝试构建零样本强化学习智能体,但它们对任务的性质或 MDP 的结构作出了假设。我们提出了原型后继测度(Proto Successor Measure):强化学习智能体在动态系统中所有可能行为的基集合。我们证明了任何可能的行为(使用访问分布表示)都可以表示为这些与策略无关的基函数的仿射组合。给定测试时的奖励函数,我们仅需找到一组线性权重,将其组合对应于最优策略的这些基函数。我们推导了一种实用算法,用于从环境中获取的无奖励互动数据中学习这些基函数,并表明该方法能够在给定奖励函数的情况下,无需额外环境互动即可生成最优策略。项目页面:https://agarwalsiddhant10.github.io/projects/psm.html。
引用
@article{arxiv.2411.19418,
title = {Proto Successor Measure: Representing the Behavior Space of an RL Agent},
author = {Siddhant Agarwal and Harshit Sikchi and Peter Stone and Amy Zhang},
journal= {arXiv preprint arXiv:2411.19418},
year = {2025}
}
备注
Under submission, 20 pages