中文

信任模型信任自身之处——基于模型的不确定性感知展开适应的Actor-Critic算法

机器学习 2024-06-24 v3

摘要

Dyna风格的基于模型的强化学习(MBRL)通过基于模型的展开将无模型智能体与预测转移模型相结合。这种结合引发了一个关键问题:“何时信任你的模型?”即,多长的展开长度能使模型提供有用的数据?Janner等人(2019)通过在训练过程中逐渐增加展开长度来解决这个问题。虽然理论上很诱人,但均匀的模型准确性是一个谬误,在需要外推时最终会崩溃。相反,我们提出问“何处信任你的模型?”利用固有的模型不确定性来考虑局部准确性,我们得到了基于模型的不确定性感知展开适应的Actor-Critic(MACURA)算法。我们提出了一种易于调优的展开机制,并在MuJoCo基准测试上证明了与最先进的深度MBRL方法相比,在数据效率和性能方面的显著改进。

关键词

引用

@article{arxiv.2405.19014,
  title  = {Trust the Model Where It Trusts Itself -- Model-Based Actor-Critic with Uncertainty-Aware Rollout Adaption},
  author = {Bernd Frauenknecht and Artur Eisele and Devdutt Subhasish and Friedrich Solowjow and Sebastian Trimpe},
  journal= {arXiv preprint arXiv:2405.19014},
  year   = {2024}
}