中文

零样本强化学习是否存在?

机器学习 2023-03-02 v2

摘要

零样本 RL 智能体是指在给定环境中,经过初始无奖励学习阶段后,无需额外规划或学习便能即时求解任意 RL 任务的智能体。这标志着从以奖励为中心的 RL 范式转向可在环境中遵循任意指令的“可控”智能体。当前 RL 智能体至多能求解相关任务族,或需对每个任务重新规划。已有使用后继特征(SFs)[BBQ+18]或前向-后向(FB)表示[TO21]的近似零样本 RL 策略被提出,但测试有限。在厘清这些方案间关系后,我们引入改进损失与新 SF 模型,并在来自无监督 RL 基准[LYL+21]的任务上系统测试零样本 RL 方案的可行性。为分离通用表示学习与探索,我们在离线设定下工作,并在若干现有回放缓冲上重复测试。SFs 似乎受基本状态特征选择所困。基于拉普拉斯特征函数的 SFs 表现良好,而基于自编码器、逆好奇心、转移模型、低秩转移矩阵、对比学习或多样性(APS)的 SFs 表现不一致。相比之下,FB 表示从单一原则性准则联合学习基本特征与后继特征。它们表现最佳且全面一致,以零样本方式在良好回放缓冲下达到有监督 RL 性能的 85%。

关键词

引用

@article{arxiv.2209.14935,
  title  = {Does Zero-Shot Reinforcement Learning Exist?},
  author = {Ahmed Touati and Jérémy Rapin and Yann Ollivier},
  journal= {arXiv preprint arXiv:2209.14935},
  year   = {2023}
}