自监督策略适应的几何视角
机器学习
2020-11-17 v1 人工智能
摘要
现实世界强化学习(RL)最具挑战性的方面之一,是大量不可预测且不断变化的干扰因素可能使智能体偏离其在训练环境中被赋予的任务。虽然智能体可以通过奖励信号学习忽略这些干扰,但现实世界的复杂性使得奖励难以获取,或者充其量极其稀疏。近期一类自监督方法已展现出在无奖励条件下应对挑战性干扰进行适应的潜力。然而,先前工作聚焦于单回合短期适应设定。本文考虑一种更贴近现实世界具体情形的长期适应设置,并提出一种关于自监督适应的几何视角。我们通过实验刻画了在该适应过程中嵌入空间内发生的过程,揭示了其对性能的一些不良影响,并展示了如何消除这些影响。此外,我们从理论上研究了基于 actor 与无 actor 的智能体如何通过操控由 actor 与 critic 函数所描述的流形几何,进一步泛化到目标环境。
引用
@article{arxiv.2011.07318,
title = {A Geometric Perspective on Self-Supervised Policy Adaptation},
author = {Cristian Bodnar and Karol Hausman and Gabriel Dulac-Arnold and Rico Jonschkowski},
journal= {arXiv preprint arXiv:2011.07318},
year = {2020}
}
备注
Contains 17 pages, 18 figures