奖励监控的表达性时序规范
机器学习
2025-12-30 v4 人工智能
计算机科学中的逻辑
摘要
在强化学习中,指定信息丰富且稠密的奖励函数仍是一个关键挑战,因为它直接影响智能体训练的效率。本文利用量化线性时序逻辑于有限迹迹的表达力量() 来合成能够为运行可观察状态轨迹生成稠密奖励流的奖励监控器。通过在训练期间提供细致的反馈,这些监控器引导智能体趋向最优行为,帮助缓解当前文献中占主导地位的布尔语义下长期决策导致的奖励稀疏问题。我们的框架具有算法中立性,仅依赖状态标记函数,能够自然地 accommodates specifying non-Markovian properties。实验结果表明,我们的定量监控器在最大化任务完成的定量度量方面始终优于并且在特定环境下优于布尔监控器,同时缩短收敛时间。
引用
@article{arxiv.2511.12808,
title = {Expressive Temporal Specifications for Reward Monitoring},
author = {Omar Adalat and Francesco Belardinelli},
journal= {arXiv preprint arXiv:2511.12808},
year = {2025}
}
备注
Accepted at AAAI-26