基于多基线的离线模仿学习及其在编译器优化中的应用
机器学习
2024-03-29 v1 编程语言
摘要
本文研究了一个强化学习(RL)问题,其中给定了一组由 K 个基线策略收集的轨迹。这些策略单独使用时可能相当次优,但在状态空间的互补部分具有很强的性能。目标是学习一个在整个状态空间上表现得与基线最佳组合一样好的策略。我们提出了一种简单的基于模仿学习的算法,给出了其精度的样本复杂度界限,并通过证明匹配的下界证明了该算法是极小极大最优的。此外,我们将该算法应用于机器学习引导的编译器优化场景,以学习用于程序内联的策略,目标是生成更小的二进制文件。我们证明,通过我们方法的几次迭代,可以学习到一个优于通过标准 RL 学习的初始策略的策略。
引用
@article{arxiv.2403.19462,
title = {Offline Imitation Learning from Multiple Baselines with Applications to Compiler Optimization},
author = {Teodor V. Marinov and Alekh Agarwal and Mircea Trofin},
journal= {arXiv preprint arXiv:2403.19462},
year = {2024}
}