中文

强化学习情境下的视觉处理

机器学习 2022-08-29 v1

摘要

尽管深度强化学习(RL)近来取得诸多成功,其方法仍数据低效,这使得以数据衡量的许多问题解决成本高昂。我们旨在通过利用无标签数据中丰富的监督信号来学习状态表示,从而弥补此缺陷。本论文介绍了三种不同的表示学习算法,它们可访问传统 RL 算法所用数据源的不同子集:(i)GRICA 受独立成分分析(ICA)启发,训练深度神经网络输出输入的统计独立特征。GrICA 通过最小化每个特征与其他特征之间的互信息来实现这一点。此外,GrICA 仅需一组未排序的环境状态集合。(ii)隐表示预测(LARP)需要更多上下文:除需要状态作为输入外,还需前一状态及连接二者的动作。该方法通过给定当前状态与动作预测环境下一状态的表示来学习状态表示。该预测器与图搜索算法一同使用。(iii)RewPred 通过训练深度神经网络学习奖励函数的平滑版本来学习状态表示。该表示用于深度 RL 的输入预处理,而奖励预测器用于奖励塑形。该方法仅需来自环境的状态-奖励对即可学习表示。我们发现每种方法各有优劣,并从实验中得出结论:在 RL 问题解决流程中引入无监督表示学习可加速学习。

关键词

引用

@article{arxiv.2208.12525,
  title  = {Visual processing in context of reinforcement learning},
  author = {Hlynur Davíð Hlynsson},
  journal= {arXiv preprint arXiv:2208.12525},
  year   = {2022}
}

备注

Doctor of Engineering thesis