中文

通过控制有效规划视界进行离线模仿学习

机器学习 2024-01-19 v1

摘要

在离线模仿学习(IL)中,我们通常假设仅拥有少量专家轨迹和一个来自次优行为的补充离线数据集,以学习专家策略。虽然最小化状态 - 动作访问分布的散度以使智能体也能考虑动作的未来后果现已成为常见做法,但在离线情况下,离线数据集中的采样误差可能导致对状态 - 动作访问的估计出现错误。在本文中,我们研究了控制有效规划视界(即降低折扣因子)的影响,这与之前研究中施加显式正则化器的做法形成对比。不幸的是,事实证明,当缩短有效规划视界时,现有算法会遭受放大的近似误差,从而导致性能显著下降。我们分析了该问题的主要原因,并提供了正确的修正措施来纠正算法。我们表明,修正后的算法通过控制有效规划视界而非显式正则化,在流行的模仿学习基准测试中取得了改进。

关键词

引用

@article{arxiv.2401.09728,
  title  = {Offline Imitation Learning by Controlling the Effective Planning Horizon},
  author = {Hee-Jun Ahn and Seong-Woong Shim and Byung-Jun Lee},
  journal= {arXiv preprint arXiv:2401.09728},
  year   = {2024}
}

备注

Preprint