中文

面向Omega正规与均值收益目标的平均奖励强化学习

人工智能 2026-03-23 v3

摘要

近期的强化学习(RL)进展使人们重新关注奖励设计以塑造智能体行为,但手动制作奖励函数繁琐且容易出错。原则方法是以形式化、无歧义的语言指定行为要求,并自动将其编译为学习目标。ω\omega-正规语言因其在形式化验证和合成中的作用而自然适用。然而,大多数现有的ω\omega-正规RL方法 operate 在以episodic、折扣为特征的setting中,存在周期性重置,这与ω\omega-正规语义在无限轨迹上的应用不符。对于continuing任务,智能体在单个不中断的生命周期内与环境交互,平均奖励标准更为恰当。我们聚焦于绝对存活规范,这是ω\omega-正规语言的一个子类,任何有限前缀都无法违反,从而自然契合持续交互。我们提出首个无模型RL框架,将绝对存活规范翻译为平均奖励目标,使其能够在未知的communicating MDP中学习,而无需episodic重置。我们还引入一种用于 lexicographic 多目标优化的奖励结构:在最大化绝对存活规范满足概率的政策中,智能体最大化外部平均奖励目标。该方法在未知的communicating MDP中保证收敛,支持无需完整环境知识的即时化简,实现无模型学习。实验在多个基准测试上表明,continuing、平均奖励方法优于竞争的折扣基于方法。

关键词

引用

@article{arxiv.2505.15693,
  title  = {Average Reward Reinforcement Learning for Omega-Regular and Mean-Payoff Objectives},
  author = {Milad Kazemi and Mateo Perez and Fabio Somenzi and Sadegh Soudjani and Ashutosh Trivedi and Alvaro Velasquez},
  journal= {arXiv preprint arXiv:2505.15693},
  year   = {2026}
}

备注

29 pages