中文

基于行为监督调优的离线强化学习

机器学习 2024-07-30 v2 人工智能

摘要

离线强化学习(RL)算法用于在提供静态交互数据集时学习高性能、良好泛化的策略。尽管近期许多离线RL方法取得了显著成功,但存在一个关键局限:它们需要对每个数据集进行大量的超参数调优以实现报告的性能,这需要通过环境中的策略动作来评估;这可能会变得繁琐。此外,大量的调优要求可能阻碍这些算法在实际领域的采用。本文提出了TD3 with Behavioral Supervisor Tuning(TD3-BST),一种训练不确定性模型并利用其引导策略在数据集支持范围内选择动作的算法。TD3-BST能够从离线数据集中学习出比以前方法更有效的策略,并在具有挑战性的基准测试中实现最佳性能,而无需进行每个数据集的调优。

关键词

引用

@article{arxiv.2404.16399,
  title  = {Offline Reinforcement Learning with Behavioral Supervisor Tuning},
  author = {Padmanaba Srinivasan and William Knottenbelt},
  journal= {arXiv preprint arXiv:2404.16399},
  year   = {2024}
}