面向稳健作物管理的深度耦合RND-PPO与领域优先噪声注入的渐进式泛化增强
机器学习
2026-05-19 v1 人工智能
摘要
我们的初步实验表明,对于在干净条件下训练的PPO策略,±2℃温度噪声会导致经济收益下降11.9%——这表明现有研究未能充分解决实际部署的鲁棒性不足问题。本文解决三个相互关联的限制,阻碍农业RL系统的实际部署:早期学习效率与晚期泛化能力之间的权衡; 内在奖励与外在奖励在探索增强PPO中的简单相加方式; 以及忽视农业状态变量上经实验证实的差异敏感性而实施的统一测量噪声注入策略。我们引入三个系统性创新:渐进式泛化增强(PGA)实施三阶段课程(清洁训练0-800剂集成剂,渐进式800-1200剂集成剂,完全增强1200-2000剂集成剂); 深度耦合RND-PPO架构,包含双通道GAE归一化、进度衰减内在系数和语义离散化; 以及基于领域的优先噪声注入,具有层次化激活。我们的实验评估显示:在佛罗里达州,相较于SOTA BERT-DQN实现,产量提升8.43%,氮肥使用效率提升16.42%;在萨拉戈萨,产量提升5.61%(尽管因地中海气候的挑战性,经济得分低3.67%);在综合扰动下,性能保留率为94.4% vs 80.0%。所有实验均使用5个随机种子,在NVIDIA A100 GPU上进行,每次运行耗时4.2±0.3小时(2000集成剂,2048步缓冲区,64 mini-batch大小)。
引用
@article{arxiv.2605.17428,
title = {Progressive Generalization Augmentation with Deeply Coupled RND-PPO and Domain-Prioritized Noise Injection for Robust Crop Management Reinforcement Learning},
author = {Wu Yang},
journal= {arXiv preprint arXiv:2605.17428},
year = {2026}
}