中文

模糊逻辑引导的奖励函数变体:用于测试强化学习程序的 oracle

软件工程 2024-07-01 v1 人工智能

摘要

强化学习 (Reinforcement Learning, RL) 已在 various 领域获得显著关注。然而,RL 程序日益复杂的测试 presents 挑战,尤其是 oracle 问题:定义 RL 程序的正确性。传统的人类 oracle 难以应对复杂性,导致测试效率低下且可能不可靠。为缓解此问题,我们提出一种自动化 oracle 方法,利用模糊逻辑来利用 RL 的属性。我们的 oracle 对代理的行为合规性进行量化,并分析其在训练剧集中的趋势。如果合规性趋势违反了从 RL 活性质派生的预期,我们将 RL 程序标记为 "Buggy"。我们在复杂度不同的 RL 程序上评估我们的 oracle,并将其与人类 oracle 进行比较。结果表明,尽管人类 oracle 在 simpler 测试场景中表现良好,但我们的模糊 oracle 在复杂环境中表现出色。该方法在测试 RL 程序方面显示出处理 oracle 问题的潜力,尤其是在复杂情况下,手动测试不足。它提高了 RL 程序测试的效率、可靠性和可扩展性。这项研究为自动化测试 RL 程序迈出了一步,并凸显了基于模糊逻辑的 oracle 在应对 oracle 问题中的潜力。

关键词

引用

@article{arxiv.2406.19812,
  title  = {Fuzzy Logic Guided Reward Function Variation: An Oracle for Testing Reinforcement Learning Programs},
  author = {Shiyu Zhang and Haoyang Song and Qixin Wang and Yu Pei},
  journal= {arXiv preprint arXiv:2406.19812},
  year   = {2024}
}

备注

10 pages, 5 figures