中文

通过奖励序列分布特征函数学习任务相关表示以实现泛化

机器学习 2022-07-01 v3 人工智能 计算机视觉与模式识别

摘要

在不同环境间对相同任务进行泛化,是视觉强化学习(RL)在真实场景中成功应用的关键。然而,来自高维观测的视觉干扰——在真实场景中十分常见——会损害视觉 RL 中学习到的表示,从而 degrading 泛化性能。为解决该问题,我们提出一种新方法,即奖励序列特征预测(Characteristic Reward Sequence Prediction, CRESP),通过学习的奖励序列分布(RSDs)提取任务相关信息,因为奖励信号在 RL 中与任务相关且对视觉干扰具有不变性。具体而言,为通过 RSDs 有效捕获任务相关信息,CRESP 引入一项辅助任务——即预测 RSDs 的特征函数——来学习任务相关表示,因为我们可以利用相应特征函数很好地近似高维分布。实验表明,CRESP 在未见环境上的泛化性能显著提升,在不同视觉干扰的 DeepMind Control 任务上优于若干 SOTA 方法。

关键词

引用

@article{arxiv.2205.10218,
  title  = {Learning Task-relevant Representations for Generalization via Characteristic Functions of Reward Sequence Distributions},
  author = {Rui Yang and Jie Wang and Zijie Geng and Mingxuan Ye and Shuiwang Ji and Bin Li and Feng Wu},
  journal= {arXiv preprint arXiv:2205.10218},
  year   = {2022}
}

备注

Accepted to KDD 2022