中文

通过熵率最小化实现可预测的强化学习动力学

机器学习 2025-06-04 v5 人工智能 系统与控制 系统与控制

摘要

在强化学习(RL)中,智能体没有动机表现出可预测的行为,且常(例如通过策略熵正则化)被推动随机化其动作以利于探索。这常使其他智能体与人类难以预测该智能体的行为,从而引发不安全场景(例如人机交互中)。我们提出一种在 RL 智能体中诱导可预测行为的新方法,称为可预测性感知 RL(PARL),采用智能体的轨迹熵率来量化可预测性。我们的方法最大化标准折扣奖励与负熵率的线性组合,从而在最优性与可预测性之间权衡。我们展示了熵率如何被形式化为平均奖励、熵率值函数如何由学习到的模型估计并纳入策略梯度算法,且演示了该方法如何在受人机用例启发的任务中产生可预测的(近最优)策略。

关键词

引用

@article{arxiv.2311.18703,
  title  = {Predictable Reinforcement Learning Dynamics through Entropy Rate Minimization},
  author = {Daniel Jarne Ornia and Giannis Delimpaltadakis and Jens Kober and Javier Alonso-Mora},
  journal= {arXiv preprint arXiv:2311.18703},
  year   = {2025}
}