中文

基于离散信息瓶颈的深度强化学习表征学习

机器学习 2023-06-01 v2

摘要

针对具有丰富观测的强化学习(RL),已有若干自监督表征学习方法被提出。对于RL的实际应用,恢复潜在潜在状态至关重要,尤其当感官输入包含无关及外生信息时。本文中,我们研究信息瓶颈如何用于在存在任务无关信息的情况下高效构建潜在状态。我们提出利用变分与离散信息瓶颈(称为RepDIB)的架构,以学习结构化的因子化表征。借助因子化表征带来的表达能力,我们引入了一种简单而有效的瓶颈,可集成于任何现有的RL自监督目标中。我们在多个在线与离线RL基准及一项真实机械臂任务上进行了验证,发现采用RepDIB的压缩表征可带来强劲性能提升,因为所学瓶颈有助于仅预测相关状态而忽略无关信息。

关键词

引用

@article{arxiv.2212.13835,
  title  = {Representation Learning in Deep RL via Discrete Information Bottleneck},
  author = {Riashat Islam and Hongyu Zang and Manan Tomar and Aniket Didolkar and Md Mofijul Islam and Samin Yeasar Arnob and Tariq Iqbal and Xin Li and Anirudh Goyal and Nicolas Heess and Alex Lamb},
  journal= {arXiv preprint arXiv:2212.13835},
  year   = {2023}
}

备注

AISTATS 2023