中文

为HER而做:强化学习中的一阶时序逻辑奖励规范(扩展版)

人工智能 2026-02-09 v1 机器学习 计算机科学中的逻辑

摘要

在这项工作中,我们提出了一种新颖的框架,用于在大状态空间的马尔可夫决策过程(MDP)中逻辑地指定非马尔可夫奖励。我们的方法利用了有限迹上的一阶理论线性时序逻辑(LTLfMT),这是经典时序逻辑的一种更具表达力的扩展,其中谓词是任意一阶理论的一阶公式,而非简单的布尔变量。这种增强的表达力使得能够在非结构化和异构数据域上指定复杂任务,促进了一个统一且可重用的框架,消除了手动谓词编码的需要。然而,与标准的LTLf规范相比,LTLfMT增强的表达力引入了额外的理论和计算挑战。我们从理论角度应对这些挑战,识别出LTLfMT的一个可处理但足以在无限状态空间上下文中进行奖励规范的片段。从实践角度,我们引入了一种基于奖励机器和事后经验回放(HER)的方法,以翻译一阶逻辑规范并解决奖励稀疏性问题。我们使用非线性算术理论在连续控制设置中评估了这种方法,表明它能够自然地指定复杂任务。实验结果表明,定制的HER实现对于解决具有复杂目标的任务至关重要。

关键词

引用

@article{arxiv.2602.06227,
  title  = {Do It for HER: First-Order Temporal Logic Reward Specification in Reinforcement Learning (Extended Version)},
  author = {Pierriccardo Olivieri and Fausto Lasca and Alessandro Gianola and Matteo Papini},
  journal= {arXiv preprint arXiv:2602.06227},
  year   = {2026}
}

备注

This is the extended version of a paper accepted at AAAI 2026