片段策略梯度设置中单步预测信息与外部奖励的线性组合:一项批判性分析
人工智能
2013-09-27 v1
摘要
具身人工智能领域的主要挑战之一是对复杂行为的开放式自主学习。我们的方法是利用与任务无关的信息驱动内在动机来支持与任务相关的学习。本文 presented 的工作是初步步骤,我们研究预测信息(传感器流过去与未来的互信息)作为一种内在驱动力,理想情况下支持任何类型的任务获取。先前的实验表明,预测信息 (PI) 是支持复杂行为自主开放式学习的良好候选者,因为最大化 PI 对应于对依赖于形态和环境的的行为规律的探索。其思想是这些规律随后可被利用以解决任何给定任务。文中展示了三个不同的实验,其结果得出结论:在片段策略梯度设置中,通常不建议将单步 PI 与外部奖励函数进行线性组合。仅对于困难任务,可以在牺牲渐近性能为代价的情况下实现大幅加速。
引用
@article{arxiv.1309.6989,
title = {Linear combination of one-step predictive information with an external reward in an episodic policy gradient setting: a critical analysis},
author = {Keyan Zahedi and Georg Martius and Nihat Ay},
journal= {arXiv preprint arXiv:1309.6989},
year = {2013}
}