马尔可夫流策略——深度 MC
机器学习
2024-09-02 v3 人工智能
摘要
折扣算法通常由于依赖短期估计而遇到评估误差,这可能阻碍其在处理简单短期任务时的有效性,并强加了不必要的时间折扣 ()。有趣的是,这些算法通常在不应用折扣的情况下进行测试,我们将这种现象称为 \textit{训练-测试偏差}。为了应对这些挑战,我们提出了马尔可夫流策略,该策略利用非负神经网络流来实现全面的前向视图预测。通过将其集成到 TD7 代码库中并使用 MuJoCo 基准进行评估,我们观察到显著的性能提升,使 MFP 成为平均奖励算法领域中一种直接、实用且易于实现的解决方案。
引用
@article{arxiv.2405.00877,
title = {Markov flow policy -- deep MC},
author = {Nitsan Soffair and Gilad Katz},
journal= {arXiv preprint arXiv:2405.00877},
year = {2024}
}
备注
Paper has been not finished