随机动作 vs 随机策略: 引导基于模型的直接策略搜索
机器学习
2022-10-24 v1
摘要
本文研究了初始数据收集方法对后续动态模型学习的影响。动态模型近似给定任务的真实转移函数, 以便直接在模型上而非在代价高昂的真实系统上执行策略搜索。本研究旨在通过比较文献中两种不同策略搜索框架所采用的初始化方法, 确定如何尽可能高效地引导一个模型。研究聚焦于在基于回合的进化方法使用概率集成框架下的模型性能。实验结果表明, 多种任务相关因素会对每种方法产生不利影响, 提示应探索混合方法。
引用
@article{arxiv.2210.11801,
title = {Random Actions vs Random Policies: Bootstrapping Model-Based Direct Policy Search},
author = {Elias Hanna and Alex Coninx and Stéphane Doncieux},
journal= {arXiv preprint arXiv:2210.11801},
year = {2022}
}
备注
ICML 2022 Workshop Adaptive Experimental Design and Active Learning in the Real World