基于性能的对抗性模仿学习引擎用于碳中和优化
机器学习
2024-07-15 v1 人工智能
摘要
在工业运营中实现碳中和已成为可持续发展日益重要的挑战和关键机遇。工业 4.0 的操作优化正面临这一重要课题。近年来,基于深度强化学习(DRL)的方法为顺序优化过程提供了前景,可用于减少碳排放。然而,现有 DRL 方法需要预定义奖励函数来评估每项行动对最终可持续发展目标(SDG)的影响。在许多实际应用中,这种奖励函数无法提前定义。为此,本研究提出了一种基于性能的对抗性模仿学习(PAIL)引擎。PAIL 是一种无需任何预定义行动奖励即可获取最优操作策略的新方法。具体而言,PAIL 采用基于 Transformer 的策略生成器编码历史信息并预测多维空间中的后续动作。整个动作序列将通过环境模拟器进行迭代更新。随后,PAIL 使用判别器来最小化生成序列与高 SDG 的真实世界样本之间的差异。并行地,设计了基于 Q 学习的绩效估计器来估计每项行动对 SDG 的影响。基于这些估计,PAIL 通过来自判别器和绩效估计器的奖励来细化生成的策略。PAIL 在多个真实世界应用案例和数据集上进行评估。实验结果表明,PAIL 在与其他最先进基线方法的比较中有效性显著。此外,PAIL 为碳中和优化提供了有意义的可解释性。
引用
@article{arxiv.2407.08910,
title = {PAIL: Performance based Adversarial Imitation Learning Engine for Carbon Neutral Optimization},
author = {Yuyang Ye and Lu-An Tang and Haoyu Wang and Runlong Yu and Wenchao Yu and Erhu He and Haifeng Chen and Hui Xiong},
journal= {arXiv preprint arXiv:2407.08910},
year = {2024}
}