用于温室气候控制的种植者参与交互式强化学习
机器学习
2025-09-09 v3 最优化与控制
摘要
气候控制对温室生产至关重要,因为它直接影响作物生长和资源利用。强化学习(RL)在该领域受到越来越多的关注,但仍面临训练效率有限和高度依赖初始学习条件等挑战。将人类(种植者)输入与 RL 智能体学习相结合的交互式 RL 为克服这些挑战提供了潜在的解决方案。然而,交互式 RL 尚未应用于温室气候控制,且可能面临与不完美输入相关的挑战。因此,本文旨在探索将带有不完美输入的交互式 RL 应用于温室气候控制的可能性与性能,具体包括:(1) 开发三种专为温室气候控制定制的代表性交互式 RL 算法(奖励塑形、策略塑形和控制共享);(2) 分析输入特征通常如何相互矛盾,以及它们之间的权衡如何使种植者的输入难以完美;(3) 提出一种基于神经网络的方法,以增强交互式 RL 智能体在输入可用性有限情况下的鲁棒性;(4) 在模拟温室环境中对带有不完美输入的三种交互式 RL 算法进行全面评估。演示表明,结合不完美种植者输入的交互式 RL 有潜力提升 RL 智能体的性能。影响动作选择的 RL 算法(如策略塑形和控制共享)在处理不完美输入时表现更好,分别实现了 8.4% 和 6.8% 的利润提升。相比之下,操纵奖励函数的算法奖励塑形对不完美输入敏感,导致利润下降 9.4%。这突出了在引入不完美输入时选择合适机制的重要性。
引用
@article{arxiv.2505.23355,
title = {Grower-in-the-Loop Interactive Reinforcement Learning for Greenhouse Climate Control},
author = {Maxiu Xiao and Jianglin Lan and Jingxin Yu and Weihong Ma and Qiuju Xie and Congcong Sun},
journal= {arXiv preprint arXiv:2505.23355},
year = {2025}
}