基于高维上下文变量的策略搜索
机器学习
2016-11-11 v1 机器学习
摘要
直接的上下文策略搜索方法学习改进策略参数,并将这些参数同时泛化到不同的上下文或任务变量。然而,从诸如相机图像等高维上下文变量中学习,在许多现实任务中仍是一个突出问题。将无监督降维方法(如主成分分析)朴素地应用于上下文变量是不够的,因为任务相关输入可能被忽略。本文中,我们提出一种在基于模型的相对熵随机搜索框架中集成维度约简的上下文策略搜索方法。我们学习一个在策略参数和上下文变量上均局部二次的奖励模型。此外,我们通过核范数正则化对上下文变量进行有监督线性维度约简。实验结果表明,所提方法优于通过主成分分析的朴素维度约简以及一种最先进的上下文策略搜索方法。
引用
@article{arxiv.1611.03231,
title = {Policy Search with High-Dimensional Context Variables},
author = {Voot Tangkaratt and Herke van Hoof and Simone Parisi and Gerhard Neumann and Jan Peters and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1611.03231},
year = {2016}
}