中文

马尔可夫流策略——深度 MC

机器学习 2024-09-02 v3 人工智能

摘要

折扣算法通常由于依赖短期估计而遇到评估误差,这可能阻碍其在处理简单短期任务时的有效性,并强加了不必要的时间折扣 (γ\gamma)。有趣的是,这些算法通常在不应用折扣的情况下进行测试,我们将这种现象称为 \textit{训练-测试偏差}。为了应对这些挑战,我们提出了马尔可夫流策略,该策略利用非负神经网络流来实现全面的前向视图预测。通过将其集成到 TD7 代码库中并使用 MuJoCo 基准进行评估,我们观察到显著的性能提升,使 MFP 成为平均奖励算法领域中一种直接、实用且易于实现的解决方案。

关键词

引用

@article{arxiv.2405.00877,
  title  = {Markov flow policy -- deep MC},
  author = {Nitsan Soffair and Gilad Katz},
  journal= {arXiv preprint arXiv:2405.00877},
  year   = {2024}
}

备注

Paper has been not finished