中文

基于运行时监控语言的灵活奖励合成

机器学习 2025-10-22 v2 人工智能 形式语言与自动机理论 机器学习

摘要

强化学习 (RL) 中的一个关键挑战是奖励 (误) 指定,即奖励函数定义不够精确,可能导致意外甚至有害的行为。事实上,RL 中的奖励函数通常被视为从状态-动作对到标量值的黑盒映射。虽然在许多情境下有效,但这种方法无法提供奖励给出的原因,这可能阻碍学习和可解释性。奖励机器通过将奖励函数表示为有限状态自动机来解决此问题,使能够指定结构化的、非马尔可夫的奖励函数。然而,其表达力通常受到正则语言的限制,无法捕捉更复杂的行为,如计数或参数化条件。在本工作中,我们在运行时监控语言 (RML) 的基础上发展出一种新的基于语言的奖励机器类。通过利用 RML 的内置记忆功能,我们的方法可以为非正则、非马尔可夫任务指定奖励函数。通过实验展示了我们方法的表达力,突出了相对于现有基于奖励机器的方法的额外优势,包括灵活的事件处理和任务指定。

关键词

引用

@article{arxiv.2510.16185,
  title  = {Expressive Reward Synthesis with the Runtime Monitoring Language},
  author = {Daniel Donnelly and Angelo Ferrando and Francesco Belardinelli},
  journal= {arXiv preprint arXiv:2510.16185},
  year   = {2025}
}