中文

时机即一切:在动作有成本与预算约束下学习选择性行动

机器学习 2023-06-06 v4

摘要

许多现实场景涉及执行动作的成本;金融系统中的交易成本和燃料成本就是常见例子。在这些场景中,在每个时间步执行动作会迅速累积成本,导致极其次优的结果。此外,反复动作会产生磨损并最终造成损坏。确定何时行动对于取得成功结果至关重要,然而,当动作产生最小有界成本时,高效学习最优行为的挑战仍未解决。本文中,我们引入了一种名为可学习脉冲控制强化算法(LICRA)的强化学习(RL)框架,用于学习在动作有成本时最优地选择何时行动以及采取哪些动作。LICRA 的核心是一种嵌套结构,结合了 RL 与一种称为脉冲控制的策略形式,其学习在动作有成本时最大化目标。我们证明,LICRA 可无缝采用任意 RL 方法,并收敛到最优选择何时执行动作及其最优幅度的策略。随后我们增强 LICRA 以处理智能体至多执行 k<k<\infty 次动作且更一般地面临预算约束的问题。我们展示 LICRA 学习最优值函数并几乎必然确保预算约束得到满足。我们通过在 OpenAI gym 的 Lunar Lander 与 Highway 环境以及金融中 Merton 投资组合问题的一个变体上实证展示了 LICRA 相对于基准 RL 方法的优越性能。

关键词

引用

@article{arxiv.2205.15953,
  title  = {Timing is Everything: Learning to Act Selectively with Costly Actions and Budgetary Constraints},
  author = {David Mguni and Aivar Sootla and Juliusz Ziomek and Oliver Slumbers and Zipeng Dai and Kun Shao and Jun Wang},
  journal= {arXiv preprint arXiv:2205.15953},
  year   = {2023}
}