中文

Multi-CALF:一种具有统计保证的策略组合方法

机器学习 2025-05-20 v1 人工智能 机器人学 系统与控制 系统与控制 最优化与控制

摘要

我们提出Multi-CALF,这是一种智能组合基于其相对价值改进的强化学习策略的算法。我们的做法将标准 RL 策略与一个具有理论依据的备选策略相结合,既继承了形式稳定性保证,又常常优于单个策略。我们证明了组合策略以已知概率收敛到指定目标集合,并提供了最大偏差和收敛时间的精确界限。在控制任务上的经验验证表明,该方法在保持稳定性保证的同时实现了性能提升。

关键词

引用

@article{arxiv.2505.12350,
  title  = {Multi-CALF: A Policy Combination Approach with Statistical Guarantees},
  author = {Georgiy Malaniya and Anton Bolychev and Grigory Yaremenko and Anastasia Krasnaya and Pavel Osinenko},
  journal= {arXiv preprint arXiv:2505.12350},
  year   = {2025}
}